決定的ポリシーを定義する
この演習では、動画で扱ったものと同じカスタム環境 MyGridWorld を使います。これはグリッドワールド環境で、エージェントの目標はできるだけ早くダイヤに到達することです。下図で指定されたとおりに、エージェントの行動を導くポリシーを定義してください。

アクションの表現は次のとおりです: (0 → left、1 → down、2 → right、3 → up)。
gymnasium ライブラリは gym として、render() 関数とあわせてインポート済みです。
この演習はコースの一部です
Pythonで学ぶGymnasiumによるReinforcement Learning
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create the environment
env = ____
state, info = env.reset()
# Define the policy
policy = ____