ПочатиПочніть безкоштовно

Визначення детермінованої політики

У цій вправі ви працюватимете з призначеним для користувача середовищем MyGridWorld, тим самим, яке ви бачили у відео. Це сітковий світ, де мета агента — якнайшвидше дістатися до діаманта. Ваше завдання — визначити політику, що спрямовує поведінку агента, як показано на рисунку нижче.

Image showing the policy: 
states 0, 1, 6, 7 - action right. 
states 2, 3 - action down. 
states 4, 5 - action left.

Дії кодуються так: (0 → left, 1 → down, 2 → right, 3 → up).

Бібліотеку gymnasium вже імпортовано для вас як gym разом із функцією render().

Ця вправа є частиною курсу

Reinforcement Learning з Gymnasium у Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create the environment
env = ____
state, info = env.reset()

# Define the policy
policy = ____
Редагувати та запускати код