Začněte nyníZačněte zdarma

Řešení prostředí Frozen Lake 8x8 pomocí SARSA

V tomto cvičení použiješ algoritmus SARSA spolu s funkcí update_q_table(), kterou jsi implementoval/a v předchozím cvičení, a naučíš agenta optimální strategii pro prostředí Frozen Lake 8x8. Toto prostředí je totožné s klasickou verzí 4x4, liší se pouze větší plochou. Pomocí algoritmu SARSA budeš postupně zlepšovat agentovu strategii na základě odměn získaných z prostředí.

Q-tabulka Q je již inicializována a připravena, stejně jako funkce update_q_table() z předchozího cvičení.

Toto cvičení je součástí kurzu

Reinforcement Learning with Gymnasium in Python

Zobrazit kurz

Pokyny k cvičení

  • Pro každou epizodu v procesu trénování proveď vybranou akci action.
  • Zvol next_action náhodně.
  • Aktualizuj Q-tabulku pro daný state a action.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

for episode in range(num_episodes):
    state, info = env.reset()
    action = env.action_space.sample()
    terminated = False
    while not terminated:
      	# Execute the action
        next_state, reward, terminated, truncated, info = ____
        # Choose the next action randomly
        next_action = ____
        # Update the Q-table
        ____
        state, action = next_state, next_action   
render_policy(get_policy())
Upravit a spustit kód