เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การนำ Policy Iteration ไปใช้เพื่อหา Optimal Policy

Policy iteration เป็นเทคนิคพื้นฐานใน RL สำหรับการหา optimal policy โดยประกอบด้วย 2 ขั้นตอนหลัก ได้แก่ policy evaluation ซึ่งคำนวณ state-value function สำหรับ policy ที่กำหนด และ policy improvement ซึ่งปรับปรุง policy โดยอิงจากค่าที่คำนวณได้ เราจะนำขั้นตอนเหล่านี้มาใช้ซ้ำแบบวนรอบเพื่อให้ได้ optimal policy ในสภาพแวดล้อม MyGridWorld แบบกำหนดเอง

ฟังก์ชัน render_policy() จะใช้แสดงขั้นตอนที่ agent ดำเนินการตาม policy

compute_state_value(state, policy) และ compute_q_value(state, action, policy) ถูกโหลดไว้ให้แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Reinforcement Learning with Gymnasium ใน Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Complete the policy evaluation function
def policy_evaluation(policy):
    V = {____: ____ for ____ in range(____)}
    return V
แก้ไขและรันโค้ด