Kom igångKom igång gratis

Lös 8x8 Frozen Lake med SARSA

I den här övningen ska du tillämpa SARSA-algoritmen – med hjälp av funktionen update_q_table() som du implementerade tidigare – för att lära agenten en optimal policy i 8x8-versionen av Frozen Lake. Miljön fungerar precis som den klassiska 4x4-varianten, men är större. Du använder SARSA-algoritmen för att iterativt förbättra agentens policy utifrån de belöningar som miljön ger.

En Q-tabell Q har redan initierats och laddats in åt dig, tillsammans med funktionen update_q_table() från föregående övning.

Den här övningen är en del av kursen

Reinforcement Learning med Gymnasium i Python

Visa kurs

Övningsinstruktioner

  • Kör den valda action för varje episod i träningsprocessen.
  • Välj next_action slumpmässigt.
  • Uppdatera Q-tabellen för angivet state och action.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

for episode in range(num_episodes):
    state, info = env.reset()
    action = env.action_space.sample()
    terminated = False
    while not terminated:
      	# Execute the action
        next_state, reward, terminated, truncated, info = ____
        # Choose the next action randomly
        next_action = ____
        # Update the Q-table
        ____
        state, action = next_state, next_action   
render_policy(get_policy())
Redigera och kör kod