ПочатиПочніть безкоштовно

Обчислення Q-значень

Ваша мета — обчислити значення дій, або Q-значення, для кожної пари «стан-дія» у користувацькому середовищі MyGridWorld за наведеної нижче політики. В RL Q-значення є ключовими, адже вони відображають очікувану корисність виконання певної дії в заданому стані з подальшим дотриманням політики.

exercise_policy.png

Середовище імпортовано як env, а також надано функцію compute_state_value() і потрібні змінні (terminal_state, num_states, num_actions, policy, gamma).

Ця вправа є частиною курсу

Reinforcement Learning з Gymnasium у Python

Переглянути курс

Інструкції до вправи

  • Доповніть функцію compute_q_value() так, щоб вона обчислювала значення дії для заданих state і action.
  • Створіть словник Q, де кожен ключ — це пара «стан-дія», а відповідне значення — Q-значення для цієї пари.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Complete the function to compute the action-value for a state-action pair
def compute_q_value(state, action):
    if state == terminal_state:
        return None   
    probability, next_state, reward, done = ____
    return ____

# Compute Q-values for each state-action pair
Q = {(____, ____): _____ for ____ in range(____) for ____ in range(____)}

print(Q)
Редагувати та запускати код