การนำ Policy Iteration ไปใช้เพื่อหา Optimal Policy
Policy iteration เป็นเทคนิคพื้นฐานใน RL สำหรับการหา optimal policy โดยประกอบด้วย 2 ขั้นตอนหลัก ได้แก่ policy evaluation ซึ่งคำนวณ state-value function สำหรับ policy ที่กำหนด และ policy improvement ซึ่งปรับปรุง policy โดยอิงจากค่าที่คำนวณได้ เราจะนำขั้นตอนเหล่านี้มาใช้ซ้ำแบบวนรอบเพื่อให้ได้ optimal policy ในสภาพแวดล้อม MyGridWorld แบบกำหนดเอง
ฟังก์ชัน render_policy() จะใช้แสดงขั้นตอนที่ agent ดำเนินการตาม policy
compute_state_value(state, policy) และ compute_q_value(state, action, policy) ถูกโหลดไว้ให้แล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Reinforcement Learning with Gymnasium ใน Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Complete the policy evaluation function
def policy_evaluation(policy):
V = {____: ____ for ____ in range(____)}
return V