始める無料で始める

最適方策に向けた方策反復の適用

方策反復は、最適な方策を見つけるためのRLにおける基本的な手法です。主に2つのステップから成り、まずは与えられた方策に対して状態価値関数を計算する「方策評価」を行い、その値に基づいて方策を更新する「方策改善」を行います。これらのステップを反復して適用し、カスタム環境 MyGridWorld で最適方策へと収束させます。

render_policy() 関数は、ある方策に従ってエージェントが辿る行動の流れを可視化するために使用します。

compute_state_value(state, policy)compute_q_value(state, action, policy) はすでに読み込まれています。

この演習はコースの一部です

Pythonで学ぶGymnasiumによるReinforcement Learning

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Complete the policy evaluation function
def policy_evaluation(policy):
    V = {____: ____ for ____ in range(____)}
    return V
コードを編集して実行