Interakční smyčka v RL
Jak už víš, RL spočívá v tom, že agent přijímá rozhodnutí v prostředí s cílem maximalizovat celkovou odměnu. Agent musí prostřednictvím interakce sám zjistit, které akce přinášejí největší odměnu.
Toto cvičení je součástí kurzu
Reinforcement Learning with Gymnasium in Python
Interaktivní praktické cvičení
Proměňte teorii v praxi s jedním z našich interaktivních cvičení
Začít cvičení