or
Acest exercițiu face parte din cursul
Descoperă lumea fascinantă a Reinforcement Learning (RL) explorând conceptele sale fundamentale, rolurile implicate și aplicațiile practice. Navighează prin cadrul RL și înțelege interacțiunea dintre agent și mediu. Vei învăța, de asemenea, cum să folosești biblioteca Gymnasium pentru a crea medii, a vizualiza stări și a efectua acțiuni, dobândind astfel o bază practică solidă în conceptele și aplicațiile RL.
Aprofundează lumea RL cu focus pe învățarea bazată pe model. Descoperă complexitățile Proceselor de Decizie Markov (MDP) și înțelege componentele lor esențiale. Îți vei extinde abilitățile prin studiul politicilor și al funcțiilor de valoare. Vei dobândi expertiză în optimizarea politicilor folosind tehnicile de iterare a politicilor și iterare a valorilor.
Pornește într-o călătorie prin domeniul dinamic al învățării fără model în RL. Ia contact cu metodele Monte Carlo de bază și aplică algoritmii de predicție Monte Carlo cu prima vizită și cu toate vizitele. Treci apoi în lumea Temporal Difference Learning, explorând algoritmul SARSA. În final, aprofundează Q-Learning și analizează convergența sa în medii dificile.
Exercițiul curent
Explorează strategii avansate în RL fără model, cu accent pe îmbunătățirea algoritmilor de luare a deciziilor. Învață despre Expected SARSA pentru actualizări mai precise ale politicilor și despre Double Q-learning pentru a reduce tendința de supraestimare. Descoperă compromisul explorare-exploatare, stăpânind strategiile epsilon-greedy și epsilon-decay pentru selectarea optimă a acțiunilor. Abordează problema Multi-Armed Bandit, aplicând strategii pentru a rezolva provocări de luare a deciziilor în condiții de incertitudine.