НачатьНачать бесплатно

Вычисление ценностей состояний для политики

Используя ту же детерминированную среду MyGridWorld, вам нужно оценить эффективность политики, заданной в предыдущем упражнении. Для этого вы вычислите функцию ценности состояний для каждого состояния в рамках данной политики.

Среда импортирована как env вместе с необходимыми переменными (terminal_state, num_states, policy, gamma).

Это упражнение является частью курса

Обучение с подкреплением с Gymnasium на Python

Посмотреть курс

Инструкции к упражнению

  • Дополните функцию compute_state_value(), чтобы она вычисляла ценность каждого состояния в рамках заданной политики.
  • Создайте словарь state_values, в котором каждый ключ — это state, а каждое значение — ценность соответствующего состояния.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Complete the function
def compute_state_value(state):
    if state == terminal_state:
        return ____
    action = ____
    _, next_state, reward, _ = env.unwrapped.P[state][action][0]
    return ____

# Compute all state values 
state_values = {____: ____ for ____ in range(____)}

print(state_values)
Редактировать и запускать код