Применение итерации по стратегии для нахождения оптимальной стратегии
Итерация по стратегии — это фундаментальный метод в обучении с подкреплением для нахождения оптимальной стратегии. Он включает два основных шага: оценку стратегии, при которой вычисляется функция ценности состояний для заданной стратегии, и улучшение стратегии, при котором стратегия обновляется на основе полученных значений. Вы будете применять эти шаги итеративно, чтобы сойтись к оптимальной стратегии в пользовательской среде MyGridWorld.
Функция render_policy() используется для отображения действий агента в соответствии со стратегией.
Функции compute_state_value(state, policy) и compute_q_value(state, action, policy) уже загружены для вас.
Это упражнение является частью курса
Обучение с подкреплением с Gymnasium на Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Complete the policy evaluation function
def policy_evaluation(policy):
V = {____: ____ for ____ in range(____)}
return V