在机器学习领域,强化学习(RL)是一种独特的方法,模型通过学习来做出决策。它在多个领域都有广泛应用。
以下关于 RL 的说法,哪一项是正确的?
本练习是课程的一部分
通过我们的互动练习之一,将理论转化为实践
走进强化学习(RL)的精彩世界,了解其基础概念、角色与应用。带您梳理 RL 框架,理解智能体与环境的交互。您还将学习如何使用 Gymnasium 库创建环境、可视化状态并执行动作,从而为 RL 概念与应用打下实践基础。
当前练习
进一步聚焦 RL 中的基于模型学习。剖析马尔可夫决策过程(MDP),理解其关键组成部分。通过学习策略与价值函数来提升您的技能。掌握策略迭代与价值迭代等策略优化方法。
踏入 RL 中无模型学习的动态领域。首先认识基础的蒙特卡罗方法,并应用首次访问与每次访问的蒙特卡罗预测算法。随后过渡到时序差分学习,探索 SARSA 算法。最后深入 Q-learning,并分析其在复杂环境中的收敛性。
深入无模型 RL 的高级策略,重点提升决策算法。学习 Expected SARSA,以获得更准确的策略更新;以及 Double Q-learning,用于缓解过度估计偏差。探索探索—利用权衡,熟练掌握 epsilon-greedy 与 epsilon-decay 等最优动作选择策略。解决多臂老虎机问题,应用策略应对不确定条件下的决策挑战。