เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

ลูปการโต้ตอบของ RL

อย่างที่ทราบกันแล้วว่า RL เกี่ยวข้องกับเอเจนต์ที่ตัดสินใจในสภาพแวดล้อมเพื่อให้ได้รางวัลสะสมสูงสุด เอเจนต์ต้องค้นหาว่าการกระทำใดให้รางวัลมากที่สุดผ่านการโต้ตอบกับสภาพแวดล้อม

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Reinforcement Learning with Gymnasium ใน Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำจริง

เปลี่ยนทฤษฎีให้เป็นการลงมือทำด้วยแบบฝึกหัดเชิงโต้ตอบหนึ่งในของเรา

เริ่มแบบฝึกหัด