or
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ทำความเข้าใจว่า Deep Reinforcement Learning พัฒนาต่อยอดจาก Reinforcement Learning แบบดั้งเดิมอย่างไร พร้อมศึกษาและลงมือสร้างอัลกอริทึม Deep Q-Learning ตัวแรก
เจาะลึก Deep Q-learning ด้วยการสร้างอัลกอริทึม DQN ต้นฉบับ ซึ่งประกอบด้วย Experience Replay, epsilon-greedy policy และ Fixed Q-targets จากนั้นสำรวจสองส่วนขยายที่น่าสนใจซึ่งช่วยเพิ่มประสิทธิภาพและความเสถียรของ Deep Q-learning ได้แก่ Double DQN และ Prioritized Experience Replay
เรียนรู้แนวคิดพื้นฐานของ policy gradient methods ใน DRL โดยเริ่มจาก policy gradient theorem ซึ่งเป็นรากฐานของวิธีการเหล่านี้ จากนั้นนำอัลกอริทึม REINFORCE มาใช้งาน ซึ่งเป็นแนวทางที่มีประสิทธิภาพในการเรียนรู้ policy บทนี้จะพาไปทำความรู้จักกับ Actor-Critic methods โดยเน้นที่อัลกอริทึม Advantage Actor-Critic (A2C) ที่ผสานจุดแข็งของทั้ง policy gradient และ value-based methods เพื่อเพิ่มประสิทธิภาพและความเสถียรในการเรียนรู้
สำรวจ Proximal Policy Optimization (PPO) เพื่อประสิทธิภาพ DRL ที่แข็งแกร่ง จากนั้นศึกษาการใช้ entropy bonus ใน PPO ซึ่งส่งเสริมการสำรวจโดยป้องกันไม่ให้ policy เข้าสู่แนวทางที่แน่นอนเร็วเกินไป รวมถึงเรียนรู้การอัปเดตแบบ batch ใน policy gradient methods และปิดท้ายด้วยการปรับ hyperparameter ด้วย Optuna เครื่องมือทรงพลังสำหรับเพิ่มประสิทธิภาพโมเดล DRL
แบบฝึกหัดปัจจุบัน