ÎncepețiÎncepe gratuit

Aplicarea Expected SARSA

Acum vei aplica algoritmul Expected SARSA într-un mediu personalizat, ilustrat mai jos. Scopul este ca agentul să navigheze printr-un grid și să ajungă la destinație cât mai repede posibil. Regulile rămân aceleași ca înainte: agentul primește o recompensă de +10 când ajunge la diamant, -2 când trece printr-un munte și -1 pentru orice altă stare.

new_cust_env.png

Mediul a fost importat ca env.

Acest exercițiu face parte din cursul

Reinforcement Learning cu Gymnasium în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Inițializează tabelul Q Q cu zerouri pentru fiecare pereche stare-acțiune.
  • Actualizează tabelul Q folosind funcția update_q_table().
  • Extrage politica sub forma unui dicționar din tabelul Q învățat.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Initialize the Q-table with random values
Q = ____
for i_episode in range(num_episodes):
    state, info = env.reset()    
    done = False    
    while not done: 
        action = env.action_space.sample()               
        next_state, reward, done, truncated, info = env.step(action)
        # Update the Q-table
        ____
        state = next_state
# Derive policy from Q-table        
policy = {state: ____ for state in range(____)}
render_policy(policy)
Editează și rulează codul