การกำหนด Deterministic Policy
ในแบบฝึกหัดนี้ จะได้ทำงานกับ environment แบบกำหนดเองที่ชื่อว่า MyGridWorld ซึ่งเป็น environment เดียวกับที่เห็นในวิดีโอ environment นี้เป็น Grid World ที่ agent มีเป้าหมายคือเดินทางไปถึงเพชรให้เร็วที่สุด โดยให้กำหนด policy ที่ควบคุมพฤติกรรมของ agent ตามที่ระบุในรูปด้านล่าง

แต่ละ action แทนด้วย: (0 → ซ้าย, 1 → ลง, 2 → ขวา, 3 → ขึ้น)
ไลบรารี gymnasium ถูก import ให้แล้วในชื่อ gym พร้อมกับฟังก์ชัน render()
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Reinforcement Learning with Gymnasium ใน Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create the environment
env = ____
state, info = env.reset()
# Define the policy
policy = ____