ÎncepețiÎncepe gratuit

Rezolvarea Frozen Lake 8x8 cu Q-learning

În acest exercițiu, vei aplica algoritmul Q-learning pentru a învăța o politică optimă de navigare prin mediul Frozen Lake 8x8, de data aceasta cu condiția „alunecos" activată. Această provocare introduce tranziții stocastice, făcând mișcările agentului imprevizibile și simulând astfel mai fidel scenariile din lumea reală.

O tabelă Q (Q) a fost inițializată și preîncărcată pentru tine, împreună cu funcția update_q_table() din exercițiul anterior și o listă goală rewards_per_episode, care va conține recompensa totală acumulată pe parcursul fiecărui episod.

Acest exercițiu face parte din cursul

Reinforcement Learning cu Gymnasium în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Pentru fiecare episod, execută acțiunea selectată și observă recompensa și starea următoare.
  • Actualizează tabela Q.
  • Adaugă total_reward la lista rewards_per_episode.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

for episode in range(10000):
    state, info = env.reset()
    total_reward = 0
    terminated = False
    while not terminated:
        action = env.action_space.sample()
        # Execute the action
        next_state, reward, terminated, truncated, info = ____
        # Update the Q-table
        ____
        state = next_state
        total_reward += reward
    # Append the total reward to the rewards list    
    rewards_per_episode.____(____)
print("Average reward per random episode: ", np.mean(rewards_per_episode))
Editează și rulează codul