or
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
เริ่มต้นสำรวจโลกของ Reinforcement Learning (RL) ด้วยการทำความเข้าใจแนวคิดพื้นฐาน บทบาท และการประยุกต์ใช้งาน เรียนรู้กรอบแนวคิดของ RL และปฏิสัมพันธ์ระหว่าง agent กับสภาพแวดล้อม รวมถึงการใช้ไลบรารี Gymnasium เพื่อสร้างสภาพแวดล้อม แสดงผล state และดำเนินการต่าง ๆ เพื่อสร้างรากฐานเชิงปฏิบัติในการทำงานกับ RL
เจาะลึก RL ในด้าน model-based learning ทำความเข้าใจ Markov Decision Processes (MDPs) และองค์ประกอบสำคัญต่าง ๆ พัฒนาทักษะด้าน policy และ value function รวมถึงฝึกเพิ่มประสิทธิภาพ policy ด้วยเทคนิค policy iteration และ value iteration
ทำความรู้จักกับ Model-Free Learning ใน RL เริ่มจากพื้นฐานของ Monte Carlo methods และการนำ first-visit และ every-visit Monte Carlo prediction มาใช้งาน จากนั้นเข้าสู่โลกของ Temporal Difference Learning และ SARSA algorithm ก่อนจะดำดิ่งสู่ Q-Learning พร้อมวิเคราะห์การ convergence ในสภาพแวดล้อมที่ท้าทาย
ศึกษากลยุทธ์ขั้นสูงใน Model-Free RL เพื่อยกระดับอัลกอริทึมการตัดสินใจ เรียนรู้ Expected SARSA สำหรับการอัปเดต policy ที่แม่นยำขึ้น และ Double Q-learning เพื่อลดปัญหาการประเมินค่าสูงเกินจริง สำรวจ Exploration-Exploitation Tradeoff พร้อมฝึกใช้กลยุทธ์ epsilon-greedy และ epsilon-decay สำหรับการเลือก action ที่เหมาะสม และรับมือกับ Multi-Armed Bandit Problem ด้วยกลยุทธ์การตัดสินใจภายใต้ความไม่แน่นอน
แบบฝึกหัดปัจจุบัน