Определение детерминированной политики
В этом упражнении вы будете работать с пользовательской средой MyGridWorld — той самой, что была показана в видео. Это сеточный мир, в котором агент должен как можно быстрее добраться до алмаза. Ваша задача — определить политику, задающую поведение агента в соответствии с рисунком ниже.

Действия обозначаются следующим образом: (0 → влево, 1 → вниз, 2 → вправо, 3 → вверх).
Библиотека gymnasium уже импортирована как gym, а также доступна функция render().
Это упражнение является частью курса
Обучение с подкреплением с Gymnasium на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create the environment
env = ____
state, info = env.reset()
# Define the policy
policy = ____