or
この演習はコースの一部です
Deep Reinforcement Learningが、従来のReinforcement Learningをどのように発展させるのかを学び、最初のDeep Q Learningアルゴリズムを実装していきます。
Experience Replay、ε-greedy、固定Qターゲットを備えたオリジナルのDQNアルゴリズムを実装し、Deep Q-learningを深く理解します。さらに、Deep Q-learningの性能と安定性を高める2つの拡張であるDouble DQNとPrioritized Experience Replayも学びます。
現在の演習
DRLにおけるpolicy gradient手法の基礎概念を学びます。まず、これらの手法の土台となるpolicy gradient定理から始めます。次に、方策学習の強力なアプローチであるREINFORCEアルゴリズムを実装します。続いて、Actor-Critic手法、特にpolicy gradientと価値ベース手法の強みを組み合わせて学習効率と安定性を高めるAdvantage Actor-Critic(A2C)アルゴリズムを取り上げます。
堅牢なDRL性能を実現するProximal Policy Optimization(PPO)を学びます。次に、PPOにおけるエントロピーボーナスを取り上げ、方策が早期に決定論的に収束するのを防いで探索を促進する方法を確認します。さらに、policy gradient手法でのバッチ更新について学びます。最後に、Optunaを用いたハイパーパラメータ最適化を行い、DRLモデルの性能を高める方法を身につけます。