Bucla de interacțiune RL
Așa cum știi deja, RL implică un agent care ia decizii într-un mediu pentru a maximiza o noțiune de recompensă cumulativă. Agentul trebuie să descopere ce acțiuni aduc cele mai mari recompense prin interacțiune.
Acest exercițiu face parte din cursul
Reinforcement Learning cu Gymnasium în Python
Exercițiu interactiv practic
Transformă teoria în practică cu unul dintre exercițiile noastre interactive
Începe exercițiul