Pekiştirmeli öğrenmede 'Exploration vs. Exploitation' ikilemini dengelemek için kullanılan, epsilon değerinin zamanla azaltıldığı yöntem hangisidir?
▼
A
Bellman Optimization
B
Monte Carlo Tree Search
C
Epsilon-Greedy Strategy
D
Policy Gradient Method
2
Markov Decision Process (MDP) yapısında, bir durumdan diğerine geçiş olasılığını tanımlayan fonksiyon aşağıdakilerden hangisidir?
▼
A
Transition Probability Function
B
Reward Function
C
Value Function
D
Discount Factor
3
Q-Learning algoritmasında, güncel durum-eylem çiftinin değerini güncellemek için kullanılan temel denklem hangisidir?
▼
A
Value Iteration
B
Kullback-Leibler Divergence
C
Bellman Equation
D
Policy Iteration
4
Derin Pekiştirmeli Öğrenmede (Deep RL) 'Experience Replay' mekanizmasının ana amacı nedir?
▼
A
Daha büyük bir action space yönetmek
B
Ödül fonksiyonunu dinamik olarak güncellemek
C
Hesaplama maliyetini düşürmek
D
Veriler arasındaki korelasyonu azaltarak kararlılığı artırmak
5
Aşağıdakilerden hangisi 'Model-Free' bir pekiştirmeli öğrenme yaklaşımıdır?
▼
A
AlphaZero
B
Value Iteration
C
SARSA
D
Dyna-Q
6
Pekiştirmeli öğrenmede, ajanın uzun vadeli toplam ödülünü maksimize etmek için kullandığı 'gamma' (indirim faktörü) değerinin 0'a yakın olması ne anlama gelir?
▼
A
Ajanın sadece anlık ödüllere odaklanması (myopic)
B
Ajanın öğrenme hızının artması
C
Ajanın rastgele hareket etmesi
D
Ajanın uzun vadeli ödülleri çok önemsemesi
7
Policy Gradient yöntemlerinde, gradientin yönünü belirlemek için kullanılan temel matematiksel teorem hangisidir?
▼
A
Bayes Theorem
B
Markov Property
C
Central Limit Theorem
D
Policy Gradient Theorem
8
Aşağıdakilerden hangisi 'Off-policy' bir öğrenme algoritmasıdır?
▼
A
Actor-Critic
B
SARSA
C
Monte Carlo Control
D
Q-Learning
9
Pekiştirmeli öğrenmede, bir durumun (state) değerini tahmin etmek yerine, doğrudan eylem (action) olasılıklarını öğrenen yaklaşıma ne ad verilir?
▼
A
Policy-based methods
B
Value-based methods
C
Dynamic Programming
D
Temporal Difference Learning
10
Double DQN kullanılmasının temel sebebi aşağıdakilerden hangisidir?
▼
A
Keşif (exploration) oranını artırmak
B
Daha hızlı eğitim süresi sağlamak
C
Q-değerlerinin aşırı tahmin edilmesini (overestimation) önlemek
D
Daha az veriyle öğrenmeyi sağlamak
11
Actor-Critic mimarisinde 'Critic' bileşeninin temel görevi nedir?
▼
A
Ödül fonksiyonunu tasarlamak
B
Seçilen eylemin değerini (value) tahmin etmek
C
Çevreyi simüle etmek
D
Eylemleri seçmek
12
Pekiştirmeli öğrenmede 'Credit Assignment Problem' (Kredi Atama Problemi) neyi ifade eder?
▼
A
Hangi eylemin nihai ödüle katkı sağladığını belirleme zorluğu
B
Ajanın ne kadar ödül aldığını hesaplama sorunu
C
Donanım kaynaklarının verimli kullanılması
D
Veri setindeki gürültü miktarı
13
Transformer mimarisinde 'Scaled Dot-Product Attention' mekanizmasının temel amacı nedir?
▼
A
Modelin parametre sayısını azaltmak için ağırlık matrislerini matris ayrıştırma yöntemiyle küçültmek.
B
Eğitim sırasında gradyan kaybolması (vanishing gradient) problemini tamamen ortadan kaldırmak.
C
Girdi dizisindeki her kelimenin diğer kelimelerle olan ilişkisini ağırlıklandırarak bağlamsal vektörler oluşturmak.
D
Veri setindeki gürültüyü temizleyerek modelin daha hızlı yakınsamasını sağlamak.
14
BERT (Bidirectional Encoder Representations from Transformers) modelini GPT'den ayıran en temel yapısal fark nedir?
▼
A
GPT, maskelenmiş dil modelleme (MLM) görevini kullanırken BERT sadece auto-regressive yöntem kullanır.
B
BERT, Transformer mimarisini kullanmaz, bunun yerine derin CNN yapılarını tercih eder.
C
BERT sadece decoder katmanlarını kullanırken, GPT sadece encoder katmanlarını kullanır.
D
BERT çift yönlü (bidirectional) bağlamı işlemek için sadece encoder katmanlarını kullanır.
15
Transformer mimarisindeki 'Multi-Head Attention' mekanizmasında farklı 'head'lerin kullanılmasının temel sebebi nedir?
▼
A
Modelin ezberleme (overfitting) yapmasını engellemek için dropout uygulamak.
B
Girdi dizisinin uzunluğunu sınırlamak ve bellek kullanımını optimize etmek.
C
Modelin farklı alt uzaylardaki (subspaces) bilgileri eş zamanlı olarak öğrenmesine olanak tanımak.
D
İşlem maliyetini düşürmek için hesaplamayı paralel işlem birimlerine dağıtmak.
16
GPT serisi modellerin eğitiminde kullanılan 'Auto-regressive' yaklaşım ne anlama gelir?
▼
A
Modelin tüm cümleyi aynı anda görerek boşlukları doldurması.
B
Girdi dizisinin hem başından hem sonundan başlayarak iki taraflı işlenmesi.
C
Eğitim verisinin etiketlenmesine gerek duymadan kendi kendini denetlemesi.
D
Modelin bir sonraki kelimeyi, kendinden önceki kelimelere dayanarak tahmin etmesi.
17
Transformer mimarisinde kullanılan 'Positional Encoding'in işlevi nedir?
▼
A
Kelime gömmelerinin (embeddings) vektör uzayındaki boyutunu normalize etmek.
B
Düşük frekanslı kelimelerin ağırlığını artırarak modelin başarısını yükseltmek.
C
Dikkat mekanizmasının (attention) hesaplama maliyetini azaltmak.
D
Modelin kelimelerin cümle içindeki sırasını anlamasını sağlamak.
18
BERT modelinin eğitiminde kullanılan 'Next Sentence Prediction' (NSP) görevinin amacı nedir?
▼
A
Daha uzun metinlerin özetlenmesi için gereken kapasiteyi artırmak.
B
İki cümle arasındaki mantıksal ilişkiyi ve ardışıklığı kavramasını sağlamak.