การสร้าง Episode สำหรับ Monte Carlo Methods
Monte Carlo methods จำเป็นต้องสร้าง episode เพื่อนำไปคำนวณ value function ในแบบฝึกหัดนี้ จะได้ implement ฟังก์ชันที่สร้าง episode โดยเลือก action แบบสุ่มจนกว่า episode จะสิ้นสุด ในแบบฝึกหัดถัดไป จะนำฟังก์ชันนี้ไปใช้กับ Monte Carlo methods บน environment แบบกำหนดเอง env ที่โหลดไว้ให้แล้ว
ฟังก์ชัน render() ถูกโหลดไว้ให้แล้วเช่นกัน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Reinforcement Learning with Gymnasium ใน Python
คำแนะนำการฝึกหัด
- รีเซ็ต environment โดยกำหนด
seedเป็น 42 - ใน episode loop ให้สุ่มเลือก
actionในแต่ละ iteration - เมื่อแต่ละ iteration สิ้นสุดลง ให้อัปเดตข้อมูล
episodeโดยเพิ่ม tuple(state, action, reward)เข้าไป
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
def generate_episode():
episode = []
# Reset the environment
state, info = ____
terminated = False
while not terminated:
# Select a random action
action = ____
next_state, reward, terminated, truncated, info = env.step(action)
render()
# Update episode data
episode.____(____)
state = next_state
return episode
print(generate_episode())