or
Toto cvičení je součástí kurzu
Zjisti, jak hluboké zpětnovazební učení překonává tradiční zpětnovazební učení, a implementuj svůj první algoritmus Deep Q Learning.
Ponořil/a ses do hlubokého Q-učení a implementuješ původní algoritmus DQN, který zahrnuje Experience Replay, epsilon-greedy strategii a fixní Q-targety. Kromě DQN prozkoumáš také dvě zajímavá rozšíření, která zlepšují výkon a stabilitu hlubokého Q-učení: Double DQN a Prioritized Experience Replay.
Aktuální cvičení
Seznámíš se se základními koncepty metod gradientu politiky v DRL. Začneš větou o gradientu politiky, která tvoří základ těchto metod. Pak implementuješ algoritmus REINFORCE, výkonný přístup k učení politik. Kapitola tě poté provede metodami Actor-Critic se zaměřením na algoritmus Advantage Actor-Critic (A2C), který kombinuje silné stránky gradientu politiky i hodnotových metod pro vyšší efektivitu a stabilitu učení.
Prozkoumej Proximal Policy Optimization (PPO) pro spolehlivý výkon DRL. Pak se podíváš na použití entropického bonusu v PPO, který podporuje průzkum prostředí a brání předčasné konvergenci k deterministickým politikám. Dozvíš se také o dávkových aktualizacích v metodách gradientu politiky. Na závěr se naučíš optimalizovat hyperparametry pomocí Optuny – výkonného nástroje pro ladění výkonu DRL modelů.