or
Это упражнение является частью курса
Погрузитесь в увлекательный мир обучения с подкреплением (RL): изучите его базовые концепции, роли и области применения. Разберитесь в структуре RL и познакомьтесь с взаимодействием агента и среды. Вы также научитесь использовать библиотеку Gymnasium для создания сред, визуализации состояний и выполнения действий — и получите практическую основу для работы с RL.
Углубитесь в обучение с подкреплением на основе модели. Разберитесь в устройстве марковских процессов принятия решений (MDP) и их ключевых компонентах. Расширьте свои навыки, изучив политики и функции ценности. Освойте оптимизацию политик с помощью методов итерации по политике и итерации по ценности.
Отправьтесь в путешествие по миру обучения без модели в RL. Познакомьтесь с методами Монте-Карло и примените алгоритмы предсказания по первому и каждому визиту. Затем перейдите к обучению с временными разностями и изучите алгоритм SARSA. Наконец, погрузитесь в Q-обучение и проанализируйте его сходимость в сложных средах.
Текущее упражнение
Изучите продвинутые стратегии RL без модели, направленные на улучшение алгоритмов принятия решений. Освойте ожидаемый SARSA для более точного обновления политик и двойное Q-обучение для снижения смещения в сторону переоценки. Исследуйте компромисс между исследованием и использованием, а также стратегии эпсилон-жадного выбора и убывания эпсилон. Решите задачу многорукого бандита, применив стратегии для принятия решений в условиях неопределённости.