ÎncepețiÎncepe gratuit

Rezolvarea CliffWalking cu strategia epsilon-greedy

Mediul CliffWalking este un punct de referință clasic pentru algoritmii de RL. Este o lume de tip grilă în care un agent trebuie să găsească un drum de la o stare de start la o stare obiectiv, evitând prăpăstiile din cale. Strategia epsilon-greedy îi permite agentului să exploreze eficient mediul și să învețe să evite prăpăstiile, maximizând recompensa cumulată. Sarcina ta este să rezolvi acest mediu folosind strategia epsilon-greedy, să calculezi recompensele obținute în fiecare episod de antrenament și să le salvezi în lista rewards_eps_greedy.

Acest exercițiu face parte din cursul

Reinforcement Learning cu Gymnasium în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • În cadrul unui episod, selectează o action folosind funcția epsilon_greedy().
  • Acumulează reward-ul primit în episode_reward.
  • După fiecare episod, adaugă totalul episode_reward în lista rewards_eps_greedy pentru o analiză ulterioară.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

rewards_eps_greedy = []
for episode in range(total_episodes):
    state, info = env.reset()
    episode_reward = 0
    for i in range(max_steps):
      	# Select action with epsilon-greedy strategy
        action = ____
        next_state, reward, terminated, truncated, info = env.step(action)
        # Accumulate reward
        ____        
        update_q_table(state, action, reward, next_state)      
        state = next_state
    # Append the toal reward to the rewards list 
    ____
print("Average reward per episode: ", np.mean(rewards_eps_greedy))
Editează și rulează codul