ÎncepețiÎncepe gratuit

Aplicarea iterației de politică pentru politica optimă

Iterația de politică este o tehnică fundamentală în RL pentru găsirea unei politici optime. Implică doi pași principali: evaluarea politicii, în care calculezi funcția de valoare a stărilor pentru o politică dată, și îmbunătățirea politicii, în care actualizezi politica pe baza acestor valori. Vei aplica acești pași iterativ pentru a converge către politica optimă în mediul personalizat MyGridWorld.

Funcția render_policy() va fi folosită pentru a afișa pașii efectuați de un agent conform unei politici.

Funcțiile compute_state_value(state, policy) și compute_q_value(state, action, policy) au fost preîncărcate pentru tine.

Acest exercițiu face parte din cursul

Reinforcement Learning cu Gymnasium în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Complete the policy evaluation function
def policy_evaluation(policy):
    V = {____: ____ for ____ in range(____)}
    return V
Editează și rulează codul