НачатьНачать бесплатно

Определение детерминированной политики

В этом упражнении вы будете работать с пользовательской средой MyGridWorld — той самой, что была показана в видео. Это сеточный мир, в котором агент должен как можно быстрее добраться до алмаза. Ваша задача — определить политику, задающую поведение агента в соответствии с рисунком ниже.

Image showing the policy: 
states 0, 1, 6, 7 - action right. 
states 2, 3 - action down. 
states 4, 5 - action left.

Действия обозначаются следующим образом: (0 → влево, 1 → вниз, 2 → вправо, 3 → вверх).

Библиотека gymnasium уже импортирована как gym, а также доступна функция render().

Это упражнение является частью курса

Обучение с подкреплением с Gymnasium на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create the environment
env = ____
state, info = env.reset()

# Define the policy
policy = ____
Редактировать и запускать код