Визначення детермінованої політики
У цій вправі ви працюватимете з призначеним для користувача середовищем MyGridWorld, тим самим, яке ви бачили у відео. Це сітковий світ, де мета агента — якнайшвидше дістатися до діаманта. Ваше завдання — визначити політику, що спрямовує поведінку агента, як показано на рисунку нижче.

Дії кодуються так: (0 → left, 1 → down, 2 → right, 3 → up).
Бібліотеку gymnasium вже імпортовано для вас як gym разом із функцією render().
Ця вправа є частиною курсу
Reinforcement Learning з Gymnasium у Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create the environment
env = ____
state, info = env.reset()
# Define the policy
policy = ____