ПочатиПочніть безкоштовно

Обчислення цінностей станів для політики

Використовуючи те саме детерміноване середовище MyGridWorld, тепер вам потрібно оцінити ефективність політики, яку ви визначили в попередній вправі. Ви зробите це, обчисливши функцію цінності стану для кожного стану за цією політикою.

Середовище імпортовано як env, а також надано потрібні змінні (terminal_state, num_states, policy, gamma).

Ця вправа є частиною курсу

Reinforcement Learning з Gymnasium у Python

Переглянути курс

Інструкції до вправи

  • Доповніть функцію compute_state_value(), щоб обчислити цінність для кожного стану за заданою політикою.
  • Створіть словник state_values, де кожен ключ — це state, а кожне значення — цінність стану.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Complete the function
def compute_state_value(state):
    if state == terminal_state:
        return ____
    action = ____
    _, next_state, reward, _ = env.unwrapped.P[state][action][0]
    return ____

# Compute all state values 
state_values = {____: ____ for ____ in range(____)}

print(state_values)
Редагувати та запускати код