or
この演習はコースの一部です
Reinforcement Learning(RL)の基礎概念、役割、活用例を通して、RLの世界に踏み出しましょう。エージェントと環境の相互作用というRLの枠組みを理解し、Gymnasiumライブラリで環境を作成し、状態を可視化し、行動を実行する方法を学びます。これにより、RLの概念と応用を実践的に身につけられます。
Model-Based Learning に焦点を当て、RLをさらに深く学びます。Markov Decision Process(MDP)の要素を整理し、その仕組みを理解しましょう。方策(policy)や価値関数についてスキルを高め、方策反復(policy iteration)と価値反復(value iteration)による方策最適化の手法を習得します。
現在の演習
RLにおけるModel-Free Learningを段階的に学びます。まず基礎となるMonte Carlo法を導入し、初回訪問法と毎回訪問法のMonte Carlo予測アルゴリズムを実装します。次にTemporal Difference Learningへ移り、SARSAアルゴリズムを学びます。最後にQ-Learningを深く掘り下げ、困難な環境における収束性を分析します。
Model-Free RLの発展的手法を扱い、意思決定アルゴリズムを強化します。方策更新をより正確にする Expected SARSA、過大評価バイアスを抑える Double Q-learning を学びます。さらに探索と活用のトレードオフを理解し、最適な行動選択に向けて epsilon-greedy と epsilon-decay の戦略を身につけます。最後にMulti-Armed Bandit問題に取り組み、不確実性下での意思決定を解く手法を適用します。