Обчислення Q-значень
Ваша мета — обчислити значення дій, або Q-значення, для кожної пари «стан-дія» у користувацькому середовищі MyGridWorld за наведеної нижче політики. В RL Q-значення є ключовими, адже вони відображають очікувану корисність виконання певної дії в заданому стані з подальшим дотриманням політики.

Середовище імпортовано як env, а також надано функцію compute_state_value() і потрібні змінні (terminal_state, num_states, num_actions, policy, gamma).
Ця вправа є частиною курсу
Reinforcement Learning з Gymnasium у Python
Інструкції до вправи
- Доповніть функцію
compute_q_value()так, щоб вона обчислювала значення дії для заданихstateіaction. - Створіть словник
Q, де кожен ключ — це пара «стан-дія», а відповідне значення — Q-значення для цієї пари.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Complete the function to compute the action-value for a state-action pair
def compute_q_value(state, action):
if state == terminal_state:
return None
probability, next_state, reward, done = ____
return ____
# Compute Q-values for each state-action pair
Q = {(____, ____): _____ for ____ in range(____) for ____ in range(____)}
print(Q)