Rezolvarea Frozen Lake 8x8 cu SARSA
În acest exercițiu, vei aplica algoritmul SARSA – împreună cu funcția update_q_table() implementată anterior – pentru a învăța o politică optimă în mediul Frozen Lake 8x8. Acest mediu este identic cu varianta clasică 4x4, singura diferență fiind dimensiunea mai mare. Vei folosi algoritmul SARSA pentru a îmbunătăți iterativ politica agentului, pe baza recompenselor primite din mediu.
Un Q-table Q a fost inițializat și preîncărcat pentru tine, împreună cu funcția update_q_table() din exercițiul anterior.
Acest exercițiu face parte din cursul
Reinforcement Learning cu Gymnasium în Python
Instrucțiuni pentru exercițiu
- Pentru fiecare episod din procesul de antrenament, execută
action-ul selectat. - Alege
next_actionîn mod aleatoriu. - Actualizează Q-table-ul pentru
state-ul șiaction-ul dat.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
for episode in range(num_episodes):
state, info = env.reset()
action = env.action_space.sample()
terminated = False
while not terminated:
# Execute the action
next_state, reward, terminated, truncated, info = ____
# Choose the next action randomly
next_action = ____
# Update the Q-table
____
state, action = next_state, next_action
render_policy(get_policy())