Цикл взаємодії в RL
Як ви вже знаєте, у RL агент приймає рішення в середовищі, щоб максимізувати певне уявлення про сумарну винагороду. Агент має з'ясувати, які дії приносять найбільшу винагороду, через взаємодію.
Ця вправа є частиною курсу
Reinforcement Learning з Gymnasium у Python
Практична інтерактивна вправа
Перетворіть теорію на практику за допомогою однієї з наших інтерактивних вправ
Почати вправу