ÎncepețiÎncepe gratuit

Bucla de interacțiune RL

Așa cum știi deja, RL implică un agent care ia decizii într-un mediu pentru a maximiza o noțiune de recompensă cumulativă. Agentul trebuie să descopere ce acțiuni aduc cele mai mari recompense prin interacțiune.

Acest exercițiu face parte din cursul

Reinforcement Learning cu Gymnasium în Python

Vezi cursul

Exercițiu interactiv practic

Transformă teoria în practică cu unul dintre exercițiile noastre interactive

Începe exercițiul