Rezolvarea Frozen Lake 8x8 cu Q-learning
În acest exercițiu, vei aplica algoritmul Q-learning pentru a învăța o politică optimă de navigare prin mediul Frozen Lake 8x8, de data aceasta cu condiția „alunecos" activată. Această provocare introduce tranziții stocastice, făcând mișcările agentului imprevizibile și simulând astfel mai fidel scenariile din lumea reală.
O tabelă Q (Q) a fost inițializată și preîncărcată pentru tine, împreună cu funcția update_q_table() din exercițiul anterior și o listă goală rewards_per_episode, care va conține recompensa totală acumulată pe parcursul fiecărui episod.
Acest exercițiu face parte din cursul
Reinforcement Learning cu Gymnasium în Python
Instrucțiuni pentru exercițiu
- Pentru fiecare episod, execută acțiunea selectată și observă recompensa și starea următoare.
- Actualizează tabela Q.
- Adaugă
total_rewardla listarewards_per_episode.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
for episode in range(10000):
state, info = env.reset()
total_reward = 0
terminated = False
while not terminated:
action = env.action_space.sample()
# Execute the action
next_state, reward, terminated, truncated, info = ____
# Update the Q-table
____
state = next_state
total_reward += reward
# Append the total reward to the rewards list
rewards_per_episode.____(____)
print("Average reward per random episode: ", np.mean(rewards_per_episode))