状態空間と行動空間を調べる
Cliff Walking 環境では、エージェントが崖に落ちないように気をつけながら、グリッド状の世界をスタートからゴールまで進みます。プレイヤーが崖の位置に移動すると、スタート地点に戻されます。ゴールに到達するまで移動を続け、到達するとエピソードが終了します。あなたのタスクは、この環境の状態空間と行動空間を調べることです。

この演習はコースの一部です
Pythonで学ぶGymnasiumによるReinforcement Learning
演習の手順
- 環境 ID
CliffWalkingを使って Cliff Walking の環境インスタンスを作成します。 - 行動空間のサイズを計算し、
num_actionsに保存します。 - 状態空間のサイズを計算し、
num_statesに保存します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create the Cliff Walking environment
env = ____
# Compute the size of the action space
num_actions = ____
# Compute the size of the state space
num_states = ____
print("Number of actions:", num_actions)
print("Number of states:", num_states)