Začněte nyníZačněte zdarma

Aplikace algoritmu Expected SARSA

Teď aplikuješ algoritmus Expected SARSA ve vlastním prostředí, které vidíš níže. Cílem je navigovat agenta mřížkou tak, aby co nejrychleji dosáhl cíle. Platí stejná pravidla jako dříve: agent dostane odměnu +10 za dosažení diamantu, -2 za průchod horami a -1 za každý jiný stav.

new_cust_env.png

Prostředí je importováno jako env.

Toto cvičení je součástí kurzu

Reinforcement Learning with Gymnasium in Python

Zobrazit kurz

Pokyny k cvičení

  • Inicializuj Q-tabulku Q nulami pro každý pár stav–akce.
  • Aktualizuj Q-tabulku pomocí funkce update_q_table().
  • Extrahuj politiku jako slovník z naučené Q-tabulky.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Initialize the Q-table with random values
Q = ____
for i_episode in range(num_episodes):
    state, info = env.reset()    
    done = False    
    while not done: 
        action = env.action_space.sample()               
        next_state, reward, done, truncated, info = env.step(action)
        # Update the Q-table
        ____
        state = next_state
# Derive policy from Q-table        
policy = {state: ____ for state in range(____)}
render_policy(policy)
Upravit a spustit kód