เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การสร้าง Episode สำหรับ Monte Carlo Methods

Monte Carlo methods จำเป็นต้องสร้าง episode เพื่อนำไปคำนวณ value function ในแบบฝึกหัดนี้ จะได้ implement ฟังก์ชันที่สร้าง episode โดยเลือก action แบบสุ่มจนกว่า episode จะสิ้นสุด ในแบบฝึกหัดถัดไป จะนำฟังก์ชันนี้ไปใช้กับ Monte Carlo methods บน environment แบบกำหนดเอง env ที่โหลดไว้ให้แล้ว

ฟังก์ชัน render() ถูกโหลดไว้ให้แล้วเช่นกัน

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Reinforcement Learning with Gymnasium ใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • รีเซ็ต environment โดยกำหนด seed เป็น 42
  • ใน episode loop ให้สุ่มเลือก action ในแต่ละ iteration
  • เมื่อแต่ละ iteration สิ้นสุดลง ให้อัปเดตข้อมูล episode โดยเพิ่ม tuple (state, action, reward) เข้าไป

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

def generate_episode():
    episode = []
    # Reset the environment
    state, info = ____
    terminated = False
    while not terminated:
      # Select a random action
      action = ____
      next_state, reward, terminated, truncated, info = env.step(action)
      render()
      # Update episode data
      episode.____(____)
      state = next_state
    return episode
print(generate_episode())
แก้ไขและรันโค้ด