Začněte nyníZačněte zdarma

Interakční smyčka v RL

Jak už víš, RL spočívá v tom, že agent přijímá rozhodnutí v prostředí s cílem maximalizovat celkovou odměnu. Agent musí prostřednictvím interakce sám zjistit, které akce přinášejí největší odměnu.

Toto cvičení je součástí kurzu

Reinforcement Learning with Gymnasium in Python

Zobrazit kurz

Interaktivní praktické cvičení

Proměňte teorii v praxi s jedním z našich interaktivních cvičení

Začít cvičení