RL-interaktionsloop
Som du nu känner till handlar RL om att en agent fattar beslut i en miljö för att maximera någon form av kumulativ belöning. Agenten måste upptäcka vilka handlingar som ger mest belöning genom interaktion.
Den här övningen är en del av kursen
Reinforcement Learning med Gymnasium i Python
Interaktiv övning med praktiskt arbete
Gör teori till handling med en av våra interaktiva övningar
Starta övningen