Kom igångKom igång gratis

Tillämpa policyiteration för optimal policy

Policyiteration är en grundläggande teknik inom RL för att hitta en optimal policy. Den består av två huvudsteg: policyutvärdering, där du beräknar tillståndsvärdefunktionen för en given policy, och policyförbättring, där du uppdaterar policyn utifrån dessa värden. Du tillämpar dessa steg iterativt tills du konvergerar mot den optimala policyn i den anpassade MyGridWorld-miljön.

Funktionen render_policy() används för att visa de steg en agent tar enligt en policy.

compute_state_value(state, policy) och compute_q_value(state, action, policy) har redan laddats in åt dig.

Den här övningen är en del av kursen

Reinforcement Learning med Gymnasium i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Complete the policy evaluation function
def policy_evaluation(policy):
    V = {____: ____ for ____ in range(____)}
    return V
Redigera och kör kod