or
Это упражнение является частью курса
Узнайте, чем глубокое обучение с подкреплением превосходит классическое, и реализуйте свой первый алгоритм Deep Q-Learning.
Погрузитесь в глубокое Q-обучение: реализуйте оригинальный алгоритм DQN с буфером воспроизведения опыта, стратегией эпсилон-жадности и фиксированными Q-целями. Затем изучите два важных расширения, которые повышают производительность и стабильность глубокого Q-обучения: Double DQN и приоритизированный буфер воспроизведения опыта.
Текущее упражнение
Освойте ключевые концепции методов градиента политики в DRL. Вы начнёте с теоремы о градиенте политики, которая лежит в основе этих методов. Затем реализуете алгоритм REINFORCE — эффективный подход к обучению политик. Далее глава познакомит вас с методами «актор-критик» и алгоритмом Advantage Actor-Critic (A2C), который объединяет преимущества методов градиента политики и методов на основе ценности для повышения эффективности и стабильности обучения.
Изучите Proximal Policy Optimization (PPO) для достижения стабильных результатов в DRL. Вы узнаете, как применять бонус за энтропию в PPO, чтобы стимулировать исследование среды и избежать преждевременной сходимости к детерминированным политикам. Также рассмотрите пакетные обновления в методах градиента политики. В завершение вы познакомитесь с оптимизацией гиперпараметров с помощью Optuna — мощного инструмента для настройки DRL-моделей.