ПочатиПочніть безкоштовно

Цикл взаємодії в RL

Як ви вже знаєте, у RL агент приймає рішення в середовищі, щоб максимізувати певне уявлення про сумарну винагороду. Агент має з'ясувати, які дії приносять найбільшу винагороду, через взаємодію.

Ця вправа є частиною курсу

Reinforcement Learning з Gymnasium у Python

Переглянути курс

Практична інтерактивна вправа

Перетворіть теорію на практику за допомогою однієї з наших інтерактивних вправ

Почати вправу