開始使用免費開始

套用策略反覆運算以求得最優策略

策略反覆運算是 RL 中用來尋找最優策略的基本技巧。它包含兩個主要步驟:策略評估,用來計算給定策略的狀態價值函式;以及策略改進,根據這些價值來更新策略。你會反覆套用這兩個步驟,讓策略在自訂的 MyGridWorld 環境中收斂到最優策略。

render_policy() 函式會用來顯示代理人在某個策略下採取的步驟。

compute_state_value(state, policy)compute_q_value(state, action, policy) 已為你預先載入。

本練習屬於課程

使用 Python 的 Gymnasium 進行強化學習

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Complete the policy evaluation function
def policy_evaluation(policy):
    V = {____: ____ for ____ in range(____)}
    return V
編輯並執行程式碼