Výpočet Q-hodnot
Tvým úkolem je vypočítat hodnoty akcí, známé také jako Q-hodnoty, pro každou dvojici stav–akce ve vlastním prostředí MyGridWorld při dodržování níže uvedené politiky. V RL jsou Q-hodnoty klíčové, protože vyjadřují očekávaný užitek provedení konkrétní akce v daném stavu, po níž agent dále sleduje danou politiku.

Prostředí je importováno jako env spolu s funkcí compute_state_value() a potřebnými proměnnými (terminal_state, num_states, num_actions, policy, gamma).
Toto cvičení je součástí kurzu
Reinforcement Learning with Gymnasium in Python
Pokyny k cvičení
- Dokonči funkci
compute_q_value()tak, aby vypočítala hodnotu akce pro danýstateaaction. - Vytvoř slovník
Q, kde každý klíč představuje dvojici stav–akce a odpovídající hodnota je Q-hodnota pro tuto dvojici.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Complete the function to compute the action-value for a state-action pair
def compute_q_value(state, action):
if state == terminal_state:
return None
probability, next_state, reward, done = ____
return ____
# Compute Q-values for each state-action pair
Q = {(____, ____): _____ for ____ in range(____) for ____ in range(____)}
print(Q)