始める無料で始める

RL のインタラクションループ

これまでに学んだとおり、RL ではエージェントが環境内で意思決定を行い、累積報酬の最大化を目指します。エージェントは環境との相互作用を通じて、どの行動が最も高い報酬をもたらすかを見つけ出さなければなりません。

この演習はコースの一部です

Pythonで学ぶGymnasiumによるReinforcement Learning

コースを見る

実践的なインタラクティブ演習

理論を実践に変える、インタラクティブな演習のひとつをお試しください

演習を開始する