Začněte nyníZačněte zdarma

Výpočet Q-hodnot

Tvým úkolem je vypočítat hodnoty akcí, známé také jako Q-hodnoty, pro každou dvojici stav–akce ve vlastním prostředí MyGridWorld při dodržování níže uvedené politiky. V RL jsou Q-hodnoty klíčové, protože vyjadřují očekávaný užitek provedení konkrétní akce v daném stavu, po níž agent dále sleduje danou politiku.

exercise_policy.png

Prostředí je importováno jako env spolu s funkcí compute_state_value() a potřebnými proměnnými (terminal_state, num_states, num_actions, policy, gamma).

Toto cvičení je součástí kurzu

Reinforcement Learning with Gymnasium in Python

Zobrazit kurz

Pokyny k cvičení

  • Dokonči funkci compute_q_value() tak, aby vypočítala hodnotu akce pro daný state a action.
  • Vytvoř slovník Q, kde každý klíč představuje dvojici stav–akce a odpovídající hodnota je Q-hodnota pro tuto dvojici.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Complete the function to compute the action-value for a state-action pair
def compute_q_value(state, action):
    if state == terminal_state:
        return None   
    probability, next_state, reward, done = ____
    return ____

# Compute Q-values for each state-action pair
Q = {(____, ____): _____ for ____ in range(____) for ____ in range(____)}

print(Q)
Upravit a spustit kód