ÎncepețiÎncepe gratuit

Îmbunătățirea unei politici

În exercițiul anterior, ai calculat Q-valorile pentru fiecare pereche stare-acțiune din mediul MyGridWorld. Acum vei folosi aceste Q-valori pentru a îmbunătăți politica existentă. Îmbunătățirea politicii este un pas esențial în învățarea prin recompensă, în care optimizezi politica alegând acțiunile care maximizează utilitatea așteptată (Q-valoarea) în fiecare stare. După îmbunătățirea politicii, vei reda mișcările corespunzătoare noii politici.

Mediul a fost importat ca env, împreună cu Q-valorile ca Q și funcția render().

Acest exercițiu face parte din cursul

Reinforcement Learning cu Gymnasium în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Găsește cea mai bună acțiune pentru fiecare stare pe baza Q-valorilor.
  • Selectează action-ul corect pe baza improved_policy.
  • Execută action-ul selectat pentru a observa rezultatul.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

improved_policy = {}

for state in range(num_states-1):
    # Find the best action for each state based on Q-values
    max_action = ____
    improved_policy[state] = max_action

terminated = False
while not terminated:
  # Select action based on policy 
  action = ____
  # Execute the action
  state, reward, terminated, truncated, info = ____
  render()
Editează și rulează codul