Začněte nyníZačněte zdarma

Aplikace iterace politik pro nalezení optimální politiky

Iterace politik je základní technika v RL pro nalezení optimální politiky. Sestává ze dvou hlavních kroků: vyhodnocení politiky, při kterém se vypočítá stavová hodnotová funkce pro danou politiku, a zlepšení politiky, při kterém se politika aktualizuje na základě těchto hodnot. Tyto kroky budeš opakovaně aplikovat, dokud nedosáhneš konvergence k optimální politice v prostředí MyGridWorld.

Funkce render_policy() slouží k zobrazení kroků, které agent provede podle dané politiky.

Funkce compute_state_value(state, policy) a compute_q_value(state, action, policy) jsou pro tebe předem načteny.

Toto cvičení je součástí kurzu

Reinforcement Learning with Gymnasium in Python

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Complete the policy evaluation function
def policy_evaluation(policy):
    V = {____: ____ for ____ in range(____)}
    return V
Upravit a spustit kód