or
Bài tập này là một phần của khóa học
Khám phá cách deep reinforcement learning cải tiến so với Reinforcement Learning truyền thống, đồng thời tìm hiểu và triển khai thuật toán Deep Q Learning đầu tiên của bạn.
Đi sâu vào Deep Q-learning bằng cách triển khai thuật toán DQN gốc, với Experience Replay, epsilon-greediness và fixed Q-targets. Vượt ra ngoài DQN, bạn sẽ khám phá hai phần mở rộng thú vị giúp cải thiện hiệu năng và độ ổn định của Deep Q-learning: Double DQN và Prioritized Experience Replay.
Bài tập hiện tại
Tìm hiểu các khái niệm nền tảng của phương pháp policy gradient trong DRL. Bạn sẽ bắt đầu với định lý policy gradient, nền tảng của các phương pháp này. Sau đó, bạn sẽ triển khai thuật toán REINFORCE, một cách tiếp cận mạnh mẽ để học policy. Chương này sẽ hướng dẫn bạn qua các phương pháp Actor-Critic, tập trung vào thuật toán Advantage Actor-Critic (A2C), kết hợp điểm mạnh của cả policy gradient và phương pháp dựa trên giá trị để tăng hiệu quả và ổn định khi học.
Khám phá Proximal Policy Optimization (PPO) để đạt hiệu năng DRL vững chắc. Tiếp theo, bạn sẽ tìm hiểu việc dùng entropy bonus trong PPO, giúp khuyến khích khám phá bằng cách ngăn hội tụ sớm vào các policy tất định. Bạn cũng sẽ học về cập nhật theo lô (batch) trong các phương pháp policy gradient. Cuối cùng, bạn sẽ tìm hiểu cách tối ưu siêu tham số với Optuna, một công cụ mạnh mẽ để tối ưu hiệu năng cho các mô hình DRL của bạn.