Aplikace algoritmu Expected SARSA
Teď aplikuješ algoritmus Expected SARSA ve vlastním prostředí, které vidíš níže. Cílem je navigovat agenta mřížkou tak, aby co nejrychleji dosáhl cíle. Platí stejná pravidla jako dříve: agent dostane odměnu +10 za dosažení diamantu, -2 za průchod horami a -1 za každý jiný stav.

Prostředí je importováno jako env.
Toto cvičení je součástí kurzu
Reinforcement Learning with Gymnasium in Python
Pokyny k cvičení
- Inicializuj Q-tabulku
Qnulami pro každý pár stav–akce. - Aktualizuj Q-tabulku pomocí funkce
update_q_table(). - Extrahuj politiku jako slovník z naučené Q-tabulky.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Initialize the Q-table with random values
Q = ____
for i_episode in range(num_episodes):
state, info = env.reset()
done = False
while not done:
action = env.action_space.sample()
next_state, reward, done, truncated, info = env.step(action)
# Update the Q-table
____
state = next_state
# Derive policy from Q-table
policy = {state: ____ for state in range(____)}
render_policy(policy)