Îmbunătățirea unei politici
În exercițiul anterior, ai calculat Q-valorile pentru fiecare pereche stare-acțiune din mediul MyGridWorld. Acum vei folosi aceste Q-valori pentru a îmbunătăți politica existentă. Îmbunătățirea politicii este un pas esențial în învățarea prin recompensă, în care optimizezi politica alegând acțiunile care maximizează utilitatea așteptată (Q-valoarea) în fiecare stare. După îmbunătățirea politicii, vei reda mișcările corespunzătoare noii politici.
Mediul a fost importat ca env, împreună cu Q-valorile ca Q și funcția render().
Acest exercițiu face parte din cursul
Reinforcement Learning cu Gymnasium în Python
Instrucțiuni pentru exercițiu
- Găsește cea mai bună acțiune pentru fiecare stare pe baza Q-valorilor.
- Selectează
action-ul corect pe bazaimproved_policy. - Execută
action-ul selectat pentru a observa rezultatul.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
improved_policy = {}
for state in range(num_states-1):
# Find the best action for each state based on Q-values
max_action = ____
improved_policy[state] = max_action
terminated = False
while not terminated:
# Select action based on policy
action = ____
# Execute the action
state, reward, terminated, truncated, info = ____
render()