เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การกำหนด Deterministic Policy

ในแบบฝึกหัดนี้ จะได้ทำงานกับ environment แบบกำหนดเองที่ชื่อว่า MyGridWorld ซึ่งเป็น environment เดียวกับที่เห็นในวิดีโอ environment นี้เป็น Grid World ที่ agent มีเป้าหมายคือเดินทางไปถึงเพชรให้เร็วที่สุด โดยให้กำหนด policy ที่ควบคุมพฤติกรรมของ agent ตามที่ระบุในรูปด้านล่าง

Image showing the policy: 
states 0, 1, 6, 7 - action right. 
states 2, 3 - action down. 
states 4, 5 - action left.

แต่ละ action แทนด้วย: (0 → ซ้าย, 1 → ลง, 2 → ขวา, 3 → ขึ้น)

ไลบรารี gymnasium ถูก import ให้แล้วในชื่อ gym พร้อมกับฟังก์ชัน render()

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Reinforcement Learning with Gymnasium ใน Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create the environment
env = ____
state, info = env.reset()

# Define the policy
policy = ____
แก้ไขและรันโค้ด