ÎncepețiÎncepe gratuit

Rezolvarea Frozen Lake 8x8 cu SARSA

În acest exercițiu, vei aplica algoritmul SARSA – împreună cu funcția update_q_table() implementată anterior – pentru a învăța o politică optimă în mediul Frozen Lake 8x8. Acest mediu este identic cu varianta clasică 4x4, singura diferență fiind dimensiunea mai mare. Vei folosi algoritmul SARSA pentru a îmbunătăți iterativ politica agentului, pe baza recompenselor primite din mediu.

Un Q-table Q a fost inițializat și preîncărcat pentru tine, împreună cu funcția update_q_table() din exercițiul anterior.

Acest exercițiu face parte din cursul

Reinforcement Learning cu Gymnasium în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Pentru fiecare episod din procesul de antrenament, execută action-ul selectat.
  • Alege next_action în mod aleatoriu.
  • Actualizează Q-table-ul pentru state-ul și action-ul dat.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

for episode in range(num_episodes):
    state, info = env.reset()
    action = env.action_space.sample()
    terminated = False
    while not terminated:
      	# Execute the action
        next_state, reward, terminated, truncated, info = ____
        # Choose the next action randomly
        next_action = ____
        # Update the Q-table
        ____
        state, action = next_state, next_action   
render_policy(get_policy())
Editează și rulează codul