Řešení prostředí Frozen Lake 8x8 pomocí SARSA
V tomto cvičení použiješ algoritmus SARSA spolu s funkcí update_q_table(), kterou jsi implementoval/a v předchozím cvičení, a naučíš agenta optimální strategii pro prostředí Frozen Lake 8x8. Toto prostředí je totožné s klasickou verzí 4x4, liší se pouze větší plochou. Pomocí algoritmu SARSA budeš postupně zlepšovat agentovu strategii na základě odměn získaných z prostředí.
Q-tabulka Q je již inicializována a připravena, stejně jako funkce update_q_table() z předchozího cvičení.
Toto cvičení je součástí kurzu
Reinforcement Learning with Gymnasium in Python
Pokyny k cvičení
- Pro každou epizodu v procesu trénování proveď vybranou akci
action. - Zvol
next_actionnáhodně. - Aktualizuj Q-tabulku pro daný
stateaaction.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
for episode in range(num_episodes):
state, info = env.reset()
action = env.action_space.sample()
terminated = False
while not terminated:
# Execute the action
next_state, reward, terminated, truncated, info = ____
# Choose the next action randomly
next_action = ____
# Update the Q-table
____
state, action = next_state, next_action
render_policy(get_policy())