Lös 8x8 Frozen Lake med SARSA
I den här övningen ska du tillämpa SARSA-algoritmen – med hjälp av funktionen update_q_table() som du implementerade tidigare – för att lära agenten en optimal policy i 8x8-versionen av Frozen Lake. Miljön fungerar precis som den klassiska 4x4-varianten, men är större. Du använder SARSA-algoritmen för att iterativt förbättra agentens policy utifrån de belöningar som miljön ger.
En Q-tabell Q har redan initierats och laddats in åt dig, tillsammans med funktionen update_q_table() från föregående övning.
Den här övningen är en del av kursen
Reinforcement Learning med Gymnasium i Python
Övningsinstruktioner
- Kör den valda
actionför varje episod i träningsprocessen. - Välj
next_actionslumpmässigt. - Uppdatera Q-tabellen för angivet
stateochaction.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
for episode in range(num_episodes):
state, info = env.reset()
action = env.action_space.sample()
terminated = False
while not terminated:
# Execute the action
next_state, reward, terminated, truncated, info = ____
# Choose the next action randomly
next_action = ____
# Update the Q-table
____
state, action = next_state, next_action
render_policy(get_policy())