Temel DQN eylem seçimi

select_action() fonksiyonu, her adımda en yüksek Q-değerine sahip eylemi seçmeni sağlar.

Fonksiyon, argüman olarak Q-ağını ve mevcut durumu alır ve en yüksek Q-değerine sahip eylemin indeksini döndürür.

Q-ağı q_network olarak örneklenmiştir ve üzerinde çalışman için örnek veri sağlamak amacıyla ortamına rastgele bir durum state = torch.rand(8) ile yüklenmiştir.

Bu egzersiz, kursun bir parçasıdır

Python ile Deep Reinforcement Learning

Kursa Göz Atın

Egzersiz talimatları

Argüman olarak verilen durumda her eyleme karşılık gelen Q-değerlerini hesapla.
En yüksek Q-değerine sahip eylemin indeksini elde et.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

def select_action(q_network, state):
    # Calculate the Q-values
    q_values = ____
    print("Q-values:", [round(x, 2) for x in q_values.tolist()])
    # Obtain the action index with highest Q-value
    action = torch.____.item()
    print(f"Action selected: {action}, with q-value {q_values[action]:.2f}")
    return action

select_action(q_network, state)

Kodu Düzenle ve Çalıştır

Bu egzersiz, kursun bir parçasıdır

Python ile Deep Reinforcement Learning

AvançadoNível de habilidade

4.8+

Kursa Ücretsiz Başla

Deep reinforcement learning’in, geleneksel Reinforcement Learning’e nasıl üstünlük sağladığını keşfet ve ilk Deep Q Learning algoritmanı inceleyip uygula.

Exercise 1: Derin pekiştirmeli öğrenmeye giriş Exercise 2: Ortam ve sinir ağı kurulumu Exercise 3: DRL eğitim döngüsü Exercise 4: Deep Q öğrenmeye giriş Exercise 5: Deep learning ve DQN Exercise 6: Q-Ağı mimarisi Exercise 7: Q-Ağını Örneklendirme Exercise 8: Temel DQN algoritması Exercise 9: Temel DQN eylem seçimi

Geçerli egzersiz

Exercise 10: Temel DQN kayıp fonksiyonu Exercise 11: Temel DQN'i eğitme

Experience Replay, epsilon-greediness ve sabit Q-hedefleri içeren orijinal DQN algoritmasını uygulayarak Deep Q-learning’e dal. DQN’in ötesinde, Deep Q-learning’in performans ve kararlılığını artıran iki etkileyici genişletmeyi keşfedeceksin: Double DQN ve Prioritized Experience Replay.

Exercise 1: Deneyim tekrar çalma ile DQN Exercise 2: Çift uçlu kuyruk Exercise 3: Deneyim tekrar oynatma tamponu Exercise 4: Deneyim Tekrarı ile DQN Exercise 5: Tam DQN algoritması Exercise 6: Epsilon-açgözlülüğü Exercise 7: Sabit Q-hedefleri Exercise 8: Tam DQN algoritmasını uygulama Exercise 9: Double DQN Exercise 10: DDQN'de çevrimiçi ağ ve hedef ağ Exercise 11: Double DQN'i eğitmek Exercise 12: Önceliklendirilmiş deneyim tekrar oynatma Exercise 13: Öncelikli deneyim tekrar oynatma tamponu Exercise 14: PER arabelleğinden örnekleme Exercise 15: Öncelikli deneyim tekrarı ile DQN

DRL’de yer alan policy gradient yöntemlerinin temel kavramlarını öğren. Bu yöntemlerin temelini oluşturan policy gradient teoremi ile başlayacaksın. Ardından politikaları öğrenmede güçlü bir yaklaşım olan REINFORCE algoritmasını uygulayacaksın. Bölüm, policy gradient ve değer tabanlı yöntemlerin güçlü yönlerini birleştirerek öğrenme verimliliği ve kararlılığını artıran Advantage Actor-Critic (A2C) yöntemine odaklanan Actor-Critic yöntemleriyle devam edecek.

Exercise 1: Politika gradyanına giriş Exercise 2: Policy ağının mimarisi Exercise 3: Ayrık dağılımlarla çalışmak Exercise 4: Policy gradient ve REINFORCE Exercise 5: REINFORCE'ta eylem seçimi Exercise 6: REINFORCE algoritmasını eğitme Exercise 7: Advantage Actor-Critic Exercise 8: Eleştirmen (Critic) ağı Exercise 9: Actor-Critic kayıp hesaplamaları Exercise 10: A2C algoritmasını eğitme

Sağlam DRL performansı için Proximal Policy Optimization (PPO)’ı keşfet. Sonraki adımda, belirleyici politikalara erken yakınsamayı önleyerek keşfi teşvik eden PPO’daki entropi bonusunu inceleyeceksin. Ayrıca policy gradient yöntemlerinde toplu (batch) güncellemeleri öğreneceksin. Son olarak, DRL modellerindeki performansı iyileştirmek için güçlü bir araç olan Optuna ile hiperparametre optimizasyonunu öğreneceksin.

Exercise 1: Yakınsal politika optimizasyonu Exercise 2: Kırpılmış olasılık oranı Exercise 3: Kırpılmış yerine geçen amaç fonksiyonu Exercise 4: Entropi bonusu ve PPO Exercise 5: Entropi oyun alanı Exercise 6: PPO algoritmasını eğitme Exercise 7: Politika gradyanında yığın güncellemeleri Exercise 8: Minibatch ve DRL Exercise 9: Toplu güncellemelerle A2C Exercise 10: Optuna ile hiperparametre optimizasyonu Exercise 11: Hiperparametre mi değil mi?Exercise 12: Optuna ile uygulama Exercise 13: Tebrikler!