Aplicarea iterației de politică pentru politica optimă
Iterația de politică este o tehnică fundamentală în RL pentru găsirea unei politici optime. Implică doi pași principali: evaluarea politicii, în care calculezi funcția de valoare a stărilor pentru o politică dată, și îmbunătățirea politicii, în care actualizezi politica pe baza acestor valori. Vei aplica acești pași iterativ pentru a converge către politica optimă în mediul personalizat MyGridWorld.
Funcția render_policy() va fi folosită pentru a afișa pașii efectuați de un agent conform unei politici.
Funcțiile compute_state_value(state, policy) și compute_q_value(state, action, policy) au fost preîncărcate pentru tine.
Acest exercițiu face parte din cursul
Reinforcement Learning cu Gymnasium în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Complete the policy evaluation function
def policy_evaluation(policy):
V = {____: ____ for ____ in range(____)}
return V