НачатьНачать бесплатно

Вычисление Q-значений

Ваша задача — вычислить ценности действий, известные как Q-значения, для каждой пары «состояние — действие» в пользовательской среде MyGridWorld при следовании приведённой ниже политике. В обучении с подкреплением Q-значения играют ключевую роль: они отражают ожидаемую полезность выполнения конкретного действия в заданном состоянии с последующим следованием политике.

exercise_policy.png

Среда импортирована как env вместе с функцией compute_state_value() и необходимыми переменными (terminal_state, num_states, num_actions, policy, gamma).

Это упражнение является частью курса

Обучение с подкреплением с Gymnasium на Python

Посмотреть курс

Инструкции к упражнению

  • Дополните функцию compute_q_value() для вычисления ценности действия для заданных state и action.
  • Создайте словарь Q, в котором каждый ключ представляет пару «состояние — действие», а соответствующее значение — Q-значение для этой пары.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Complete the function to compute the action-value for a state-action pair
def compute_q_value(state, action):
    if state == terminal_state:
        return None   
    probability, next_state, reward, done = ____
    return ____

# Compute Q-values for each state-action pair
Q = {(____, ____): _____ for ____ in range(____) for ____ in range(____)}

print(Q)
Редактировать и запускать код