НачатьНачать бесплатно

Применение итерации по стратегии для нахождения оптимальной стратегии

Итерация по стратегии — это фундаментальный метод в обучении с подкреплением для нахождения оптимальной стратегии. Он включает два основных шага: оценку стратегии, при которой вычисляется функция ценности состояний для заданной стратегии, и улучшение стратегии, при котором стратегия обновляется на основе полученных значений. Вы будете применять эти шаги итеративно, чтобы сойтись к оптимальной стратегии в пользовательской среде MyGridWorld.

Функция render_policy() используется для отображения действий агента в соответствии со стратегией.

Функции compute_state_value(state, policy) и compute_q_value(state, action, policy) уже загружены для вас.

Это упражнение является частью курса

Обучение с подкреплением с Gymnasium на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Complete the policy evaluation function
def policy_evaluation(policy):
    V = {____: ____ for ____ in range(____)}
    return V
Редактировать и запускать код