Tillämpa policyiteration för optimal policy
Policyiteration är en grundläggande teknik inom RL för att hitta en optimal policy. Den består av två huvudsteg: policyutvärdering, där du beräknar tillståndsvärdefunktionen för en given policy, och policyförbättring, där du uppdaterar policyn utifrån dessa värden. Du tillämpar dessa steg iterativt tills du konvergerar mot den optimala policyn i den anpassade MyGridWorld-miljön.
Funktionen render_policy() används för att visa de steg en agent tar enligt en policy.
compute_state_value(state, policy) och compute_q_value(state, action, policy) har redan laddats in åt dig.
Den här övningen är en del av kursen
Reinforcement Learning med Gymnasium i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Complete the policy evaluation function
def policy_evaluation(policy):
V = {____: ____ for ____ in range(____)}
return V