ลูปการโต้ตอบของ RL
อย่างที่ทราบกันแล้วว่า RL เกี่ยวข้องกับเอเจนต์ที่ตัดสินใจในสภาพแวดล้อมเพื่อให้ได้รางวัลสะสมสูงสุด เอเจนต์ต้องค้นหาว่าการกระทำใดให้รางวัลมากที่สุดผ่านการโต้ตอบกับสภาพแวดล้อม
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Reinforcement Learning with Gymnasium ใน Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำจริง
เปลี่ยนทฤษฎีให้เป็นการลงมือทำด้วยแบบฝึกหัดเชิงโต้ตอบหนึ่งในของเรา
เริ่มแบบฝึกหัด