方策の改善
前の演習では、MyGridWorld 環境における各状態—行動ペアのQ値を計算しました。ここでは、そのQ値を使って既存の方策を改善します。方策の改善は強化学習における重要なステップで、各状態で期待効用(Q値)を最大化する行動を選ぶことで方策を洗練させます。方策を改善したら、この新しい方策に従った動きをレンダリングして確認します。
環境は env として、Q値は Q として、そして render() 関数とともに読み込まれています。
この演習はコースの一部です
Pythonで学ぶGymnasiumによるReinforcement Learning
演習の手順
- Q値に基づいて、各状態の最適な行動を見つけましょう。
improved_policyに基づいて、正しいactionを選択します。- 選択した
actionを実行して、その結果を確認します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
improved_policy = {}
for state in range(num_states-1):
# Find the best action for each state based on Q-values
max_action = ____
improved_policy[state] = max_action
terminated = False
while not terminated:
# Select action based on policy
action = ____
# Execute the action
state, reward, terminated, truncated, info = ____
render()