Вычисление ценностей состояний для политики
Используя ту же детерминированную среду MyGridWorld, вам нужно оценить эффективность политики, заданной в предыдущем упражнении. Для этого вы вычислите функцию ценности состояний для каждого состояния в рамках данной политики.
Среда импортирована как env вместе с необходимыми переменными (terminal_state, num_states, policy, gamma).
Это упражнение является частью курса
Обучение с подкреплением с Gymnasium на Python
Инструкции к упражнению
- Дополните функцию
compute_state_value(), чтобы она вычисляла ценность каждого состояния в рамках заданной политики. - Создайте словарь
state_values, в котором каждый ключ — этоstate, а каждое значение — ценность соответствующего состояния.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Complete the function
def compute_state_value(state):
if state == terminal_state:
return ____
action = ____
_, next_state, reward, _ = env.unwrapped.P[state][action][0]
return ____
# Compute all state values
state_values = {____: ____ for ____ in range(____)}
print(state_values)