or
Ця вправа є частиною курсу
Пориньте у світ Reinforcement Learning (RL), дослідивши його базові поняття, ролі та застосування. Розберіть рамку RL і взаємодію агента із середовищем. Ви також навчитеся працювати з бібліотекою Gymnasium: створювати середовища, візуалізувати стани та виконувати дії — щоб отримати практичний фундамент у концепціях і застосуваннях RL.
Заглибтеся в RL з фокусом на навчанні на основі моделі. Розкрийте сутність марковських процесів прийняття рішень (MDP), зрозумівши їхні ключові компоненти. Розширте свої навички, вивчивши політики та функції цінності. Опануйте оптимізацію політики за допомогою policy iteration і value iteration.
Пройдіть шлях крізь динамічний світ навчання без моделі в RL. Ознайомтеся з базовими методами Монте-Карло та застосуйте алгоритми прогнозування першого відвідування і кожного відвідування. Перейдіть до навчання з тимчасовою різницею, дослідивши алгоритм SARSA. Нарешті, зануртеся у Q-learning і проаналізуйте його збіжність у складних середовищах.
Опановуйте просунуті стратегії у модель-вільному RL, зосереджені на підсиленні алгоритмів ухвалення рішень. Дізнайтеся про Expected SARSA для точніших оновлень політики та Double Q-learning для зменшення упередження через переоцінку. Розгляньте компроміс дослідження та використання, опанувавши стратегії epsilon-greedy та epsilon-decay для оптимального вибору дій. Візьміться за задачу одноруких бандитів, застосовуючи стратегії для розв'язання проблем ухвалення рішень в умовах невизначеності.
Поточна вправа