or
Acest exercițiu face parte din cursul
Descoperă cum Deep Reinforcement Learning îmbunătățește Reinforcement Learning clasic, studiind și implementând primul tău algoritm Deep Q-Learning.
Aprofundează Deep Q-learning implementând algoritmul DQN original, cu Experience Replay, strategia epsilon-greedy și Q-target-uri fixe. Dincolo de DQN, vei explora două extensii importante care îmbunătățesc performanța și stabilitatea Deep Q-learning-ului: Double DQN și Prioritized Experience Replay.
Exercițiul curent
Învață conceptele fundamentale ale metodelor policy gradient din DRL. Vei începe cu teorema policy gradient, care stă la baza acestor metode. Apoi vei implementa algoritmul REINFORCE, o abordare eficientă pentru învățarea politicilor. Capitolul te va ghida prin metodele Actor-Critic, cu accent pe algoritmul Advantage Actor-Critic (A2C), care combină punctele forte ale metodelor policy gradient și ale celor bazate pe valori, pentru a îmbunătăți eficiența și stabilitatea învățării.
Explorează Proximal Policy Optimization (PPO) pentru performanță robustă în DRL. Vei analiza utilizarea unui bonus de entropie în PPO, care încurajează explorarea și previne convergența prematură către politici deterministe. Vei învăța, de asemenea, despre actualizările pe loturi în metodele policy gradient. În final, vei descoperi optimizarea hiperparametrilor cu Optuna, un instrument puternic pentru maximizarea performanței modelelor DRL.