始める無料で始める

決定的ポリシーを定義する

この演習では、動画で扱ったものと同じカスタム環境 MyGridWorld を使います。これはグリッドワールド環境で、エージェントの目標はできるだけ早くダイヤに到達することです。下図で指定されたとおりに、エージェントの行動を導くポリシーを定義してください。

Image showing the policy: 
states 0, 1, 6, 7 - action right. 
states 2, 3 - action down. 
states 4, 5 - action left.

アクションの表現は次のとおりです: (0 → left、1 → down、2 → right、3 → up)。

gymnasium ライブラリは gym として、render() 関数とあわせてインポート済みです。

この演習はコースの一部です

Pythonで学ぶGymnasiumによるReinforcement Learning

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create the environment
env = ____
state, info = env.reset()

# Define the policy
policy = ____
コードを編集して実行