or
Den här övningen är en del av kursen
Utforska förstärkningsinlärningens (RL) grundläggande koncept, roller och tillämpningar. Lär dig hur RL-ramverket fungerar och hur agenter och miljöer samverkar. Du får också lära dig att använda Gymnasium-biblioteket för att skapa miljöer, visualisera tillstånd och utföra åtgärder – och bygger på så sätt en praktisk grund inom RL.
Fördjupa dig i RL med fokus på modellbaserad inlärning. Utforska Markovska beslutsprocesser (MDP) och förstå deras centrala komponenter. Bygg vidare på dina kunskaper om policyer och värdefunktioner. Lär dig att optimera policyer med hjälp av policyiteration och värdeiteration.
Utforska den dynamiska världen av modellfri inlärning inom RL. Bekanta dig med Monte Carlo-metoder och tillämpa algoritmer för Monte Carlo-prediktion baserade på första och varje besök. Gå sedan vidare till temporal differensinlärning och SARSA-algoritmen. Slutligen dyker du ner i Q-inlärning och analyserar dess konvergens i krävande miljöer.
Fördjupa dig i avancerade strategier inom modellfri RL med fokus på att förbättra beslutsalgoritmer. Lär dig om Expected SARSA för mer träffsäkra policyuppdateringar och Double Q-inlärning för att minska överskattningsbias. Utforska avvägningen mellan utforskning och utnyttjande, och bemästra epsilon-giriga och epsilon-avklingande strategier för optimal aktionsval. Arbeta med det flerbenta banditproblemet och tillämpa strategier för beslutsfattande under osäkerhet.
Aktuell övning