Temel DQN kayıp fonksiyonu

select_action() işlevi artık hazır olduğuna göre, ajanını eğitebilmek için son bir adımdasın: şimdi calculate_loss()'u uygulayacaksın.

calculate_loss() bir bölümün herhangi bir adımı için ağın kaybını döndürür.

Referans olarak, kayıp şu şekilde verilir:

Aşağıdaki örnek veriler egzersize yüklendi:

state = torch.rand(8)
next_state = torch.rand(8)
action = select_action(q_network, state)
reward = 1
gamma = .99
done = False

Bu egzersiz, kursun bir parçasıdır

Python ile Deep Reinforcement Learning

Kursa Göz Atın

Egzersiz talimatları

Mevcut durumun Q-değerini elde et.
Sonraki durumun Q-değerini elde et.
Hedef Q-değerini (TD-target) hesapla.
Kayıp fonksiyonunu, yani karesel Bellman Hatasını hesapla.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

def calculate_loss(q_network, state, action, next_state, reward, done):
    q_values = q_network(state)
    print(f'Q-values: {q_values}')
    # Obtain the current state Q-value
    current_state_q_value = q_values[____]
    print(f'Current state Q-value: {current_state_q_value:.2f}')
    # Obtain the next state Q-value
    next_state_q_value = q_network(next_state).____    
    print(f'Next state Q-value: {next_state_q_value:.2f}')
    # Calculate the target Q-value
    target_q_value = ____ + gamma * ____ * (1-done)
    print(f'Target Q-value: {target_q_value:.2f}')
    # Obtain the loss
    loss = nn.MSELoss()(____, ____)
    print(f'Loss: {loss:.2f}')
    return loss

calculate_loss(q_network, state, action, next_state, reward, done)

Kodu Düzenle ve Çalıştır

Bu egzersiz, kursun bir parçasıdır

Python ile Deep Reinforcement Learning

AvançadoNível de habilidade

4.8+

Kursa Ücretsiz Başla

Deep reinforcement learning’in, geleneksel Reinforcement Learning’e nasıl üstünlük sağladığını keşfet ve ilk Deep Q Learning algoritmanı inceleyip uygula.

Exercise 1: Derin pekiştirmeli öğrenmeye giriş Exercise 2: Ortam ve sinir ağı kurulumu Exercise 3: DRL eğitim döngüsü Exercise 4: Deep Q öğrenmeye giriş Exercise 5: Deep learning ve DQN Exercise 6: Q-Ağı mimarisi Exercise 7: Q-Ağını Örneklendirme Exercise 8: Temel DQN algoritması Exercise 9: Temel DQN eylem seçimi Exercise 10: Temel DQN kayıp fonksiyonu

Geçerli egzersiz

Exercise 11: Temel DQN'i eğitme

Experience Replay, epsilon-greediness ve sabit Q-hedefleri içeren orijinal DQN algoritmasını uygulayarak Deep Q-learning’e dal. DQN’in ötesinde, Deep Q-learning’in performans ve kararlılığını artıran iki etkileyici genişletmeyi keşfedeceksin: Double DQN ve Prioritized Experience Replay.

Exercise 1: Deneyim tekrar çalma ile DQN Exercise 2: Çift uçlu kuyruk Exercise 3: Deneyim tekrar oynatma tamponu Exercise 4: Deneyim Tekrarı ile DQN Exercise 5: Tam DQN algoritması Exercise 6: Epsilon-açgözlülüğü Exercise 7: Sabit Q-hedefleri Exercise 8: Tam DQN algoritmasını uygulama Exercise 9: Double DQN Exercise 10: DDQN'de çevrimiçi ağ ve hedef ağ Exercise 11: Double DQN'i eğitmek Exercise 12: Önceliklendirilmiş deneyim tekrar oynatma Exercise 13: Öncelikli deneyim tekrar oynatma tamponu Exercise 14: PER arabelleğinden örnekleme Exercise 15: Öncelikli deneyim tekrarı ile DQN

DRL’de yer alan policy gradient yöntemlerinin temel kavramlarını öğren. Bu yöntemlerin temelini oluşturan policy gradient teoremi ile başlayacaksın. Ardından politikaları öğrenmede güçlü bir yaklaşım olan REINFORCE algoritmasını uygulayacaksın. Bölüm, policy gradient ve değer tabanlı yöntemlerin güçlü yönlerini birleştirerek öğrenme verimliliği ve kararlılığını artıran Advantage Actor-Critic (A2C) yöntemine odaklanan Actor-Critic yöntemleriyle devam edecek.

Exercise 1: Politika gradyanına giriş Exercise 2: Policy ağının mimarisi Exercise 3: Ayrık dağılımlarla çalışmak Exercise 4: Policy gradient ve REINFORCE Exercise 5: REINFORCE'ta eylem seçimi Exercise 6: REINFORCE algoritmasını eğitme Exercise 7: Advantage Actor-Critic Exercise 8: Eleştirmen (Critic) ağı Exercise 9: Actor-Critic kayıp hesaplamaları Exercise 10: A2C algoritmasını eğitme

Sağlam DRL performansı için Proximal Policy Optimization (PPO)’ı keşfet. Sonraki adımda, belirleyici politikalara erken yakınsamayı önleyerek keşfi teşvik eden PPO’daki entropi bonusunu inceleyeceksin. Ayrıca policy gradient yöntemlerinde toplu (batch) güncellemeleri öğreneceksin. Son olarak, DRL modellerindeki performansı iyileştirmek için güçlü bir araç olan Optuna ile hiperparametre optimizasyonunu öğreneceksin.

Exercise 1: Yakınsal politika optimizasyonu Exercise 2: Kırpılmış olasılık oranı Exercise 3: Kırpılmış yerine geçen amaç fonksiyonu Exercise 4: Entropi bonusu ve PPO Exercise 5: Entropi oyun alanı Exercise 6: PPO algoritmasını eğitme Exercise 7: Politika gradyanında yığın güncellemeleri Exercise 8: Minibatch ve DRL Exercise 9: Toplu güncellemelerle A2C Exercise 10: Optuna ile hiperparametre optimizasyonu Exercise 11: Hiperparametre mi değil mi?Exercise 12: Optuna ile uygulama Exercise 13: Tebrikler!