or
Den här övningen är en del av kursen
Upptäck hur djup förstärkningsinlärning förbättrar traditionell förstärkningsinlärning, och implementera din första djupa Q-inlärningsalgoritm.
Fördjupa dig i djup Q-inlärning genom att implementera den ursprungliga DQN-algoritmen med Experience Replay, epsilon-girighet och fasta Q-mål. Därefter utforskar du två intressanta utökningar som förbättrar prestanda och stabilitet i djup Q-inlärning: Double DQN och Prioritized Experience Replay.
Lär dig de grundläggande begreppen inom policygradientmetoder i DRL. Du börjar med policygradientteoremet, som utgör grunden för dessa metoder, och implementerar sedan REINFORCE-algoritmen – en kraftfull metod för att lära in policyer. Kapitlet leder dig sedan vidare till Actor-Critic-metoder, med fokus på Advantage Actor-Critic-algoritmen (A2C), som kombinerar styrkan hos både policygradient- och värdebaserade metoder för att förbättra inlärningens effektivitet och stabilitet.
Utforska Proximal Policy Optimization (PPO) för robust DRL-prestanda. Du undersöker sedan hur en entropibonus i PPO uppmuntrar utforskning genom att förhindra att modellen för tidigt låser sig till deterministiska policyer. Du lär dig också om batchuppdateringar i policygradientmetoder. Avslutningsvis går vi igenom hyperparameteroptimering med Optuna – ett kraftfullt verktyg för att optimera prestandan i dina DRL-modeller.
Aktuell övning