Rezolvarea CliffWalking cu strategia epsilon-greedy
Mediul CliffWalking este un punct de referință clasic pentru algoritmii de RL. Este o lume de tip grilă în care un agent trebuie să găsească un drum de la o stare de start la o stare obiectiv, evitând prăpăstiile din cale. Strategia epsilon-greedy îi permite agentului să exploreze eficient mediul și să învețe să evite prăpăstiile, maximizând recompensa cumulată. Sarcina ta este să rezolvi acest mediu folosind strategia epsilon-greedy, să calculezi recompensele obținute în fiecare episod de antrenament și să le salvezi în lista rewards_eps_greedy.
Acest exercițiu face parte din cursul
Reinforcement Learning cu Gymnasium în Python
Instrucțiuni pentru exercițiu
- În cadrul unui episod, selectează o
actionfolosind funcțiaepsilon_greedy(). - Acumulează
reward-ul primit înepisode_reward. - După fiecare episod, adaugă totalul
episode_rewardîn listarewards_eps_greedypentru o analiză ulterioară.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
rewards_eps_greedy = []
for episode in range(total_episodes):
state, info = env.reset()
episode_reward = 0
for i in range(max_steps):
# Select action with epsilon-greedy strategy
action = ____
next_state, reward, terminated, truncated, info = env.step(action)
# Accumulate reward
____
update_q_table(state, action, reward, next_state)
state = next_state
# Append the toal reward to the rewards list
____
print("Average reward per episode: ", np.mean(rewards_eps_greedy))