or
本练习是课程的一部分
了解深度强化学习如何改进传统强化学习,并实现您的第一个深度 Q 学习算法。
通过实现原始 DQN 算法深入学习深度 Q 学习,其包含经验回放、epsilon-贪心与固定 Q 目标。接着,您将探索两种能够提升深度 Q 学习性能与稳定性的扩展:Double DQN 与优先级经验回放。
当前练习
学习 DRL 中策略梯度方法的核心概念。您将从奠定这些方法基础的策略梯度定理开始。随后实现 REINFORCE 算法,这是一种强大的策略学习方法。接着,章节将引导您学习 Actor-Critic 方法,重点讲解优势 Actor-Critic(A2C)算法,它结合了策略梯度与基于价值的方法优势,从而提升学习效率与稳定性。
探索近端策略优化(PPO),实现稳健的 DRL 表现。接着,您将研究在 PPO 中使用熵奖励,以避免过早收敛到确定性策略,从而鼓励探索。您还将学习策略梯度方法中的批量更新。最后,您将了解如何使用 Optuna 进行超参数优化,以充分提升 DRL 模型的性能。