Обчислення цінностей станів для політики
Використовуючи те саме детерміноване середовище MyGridWorld, тепер вам потрібно оцінити ефективність політики, яку ви визначили в попередній вправі. Ви зробите це, обчисливши функцію цінності стану для кожного стану за цією політикою.
Середовище імпортовано як env, а також надано потрібні змінні (terminal_state, num_states, policy, gamma).
Ця вправа є частиною курсу
Reinforcement Learning з Gymnasium у Python
Інструкції до вправи
- Доповніть функцію
compute_state_value(), щоб обчислити цінність для кожного стану за заданою політикою. - Створіть словник
state_values, де кожен ключ — цеstate, а кожне значення — цінність стану.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Complete the function
def compute_state_value(state):
if state == terminal_state:
return ____
action = ____
_, next_state, reward, _ = env.unwrapped.P[state][action][0]
return ____
# Compute all state values
state_values = {____: ____ for ____ in range(____)}
print(state_values)