การสร้าง Q-Network
เมื่อกำหนดสถาปัตยกรรมของ Q-Network แล้ว ก็ถึงเวลาสร้าง network จริงที่ agent จะใช้งาน พร้อมกับ optimizer สภาพแวดล้อม Lunar Lander มี state space ขนาด 8 มิติ และ action space ขนาด 4 มิติ (ได้แก่ 0: do nothing, 1: left thruster, 2: main engine, 3: right thruster)
คลาส QNetwork จากแบบฝึกหัดก่อนหน้าพร้อมใช้งานแล้ว
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Deep Reinforcement Learning ด้วย Python
คำแนะนำการฝึกหัด
- สร้าง Q-Network สำหรับสภาพแวดล้อม Lunar Lander
- กำหนด Adam optimizer ให้กับโครงข่ายประสาทเทียม โดยระบุ learning rate เป็น 0.0001
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
state_size = 8
action_size = 4
# Instantiate the Q Network
q_network = QNetwork(____, ____)
# Specify the optimizer learning rate
optimizer = optim.Adam(q_network.parameters(), ____)
print("Q-Network initialized as:\n", q_network)