Aplikace iterace politik pro nalezení optimální politiky
Iterace politik je základní technika v RL pro nalezení optimální politiky. Sestává ze dvou hlavních kroků: vyhodnocení politiky, při kterém se vypočítá stavová hodnotová funkce pro danou politiku, a zlepšení politiky, při kterém se politika aktualizuje na základě těchto hodnot. Tyto kroky budeš opakovaně aplikovat, dokud nedosáhneš konvergence k optimální politice v prostředí MyGridWorld.
Funkce render_policy() slouží k zobrazení kroků, které agent provede podle dané politiky.
Funkce compute_state_value(state, policy) a compute_q_value(state, action, policy) jsou pro tebe předem načteny.
Toto cvičení je součástí kurzu
Reinforcement Learning with Gymnasium in Python
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Complete the policy evaluation function
def policy_evaluation(policy):
V = {____: ____ for ____ in range(____)}
return V