Zacznij terazZacznij za darmo

Zastosowanie iteracji polityki do znalezienia optymalnej polityki

Iteracja polityki to podstawowa technika w uczeniu przez wzmacnianie (RL), służąca do wyznaczania optymalnej polityki. Składa się z dwóch głównych kroków: ewaluacji polityki, w której obliczasz funkcję wartości stanu dla danej polityki, oraz poprawy polityki, w której aktualizujesz politykę na podstawie tych wartości. Oba kroki będziesz stosować iteracyjnie, aż do osiągnięcia zbieżności do optymalnej polityki w niestandardowym środowisku MyGridWorld.

Do wyświetlania kroków podejmowanych przez agenta zgodnie z daną polityką służy funkcja render_policy().

Funkcje compute_state_value(state, policy) oraz compute_q_value(state, action, policy) zostały wcześniej załadowane.

To ćwiczenie jest częścią kursu

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Complete the policy evaluation function
def policy_evaluation(policy):
    V = {____: ____ for ____ in range(____)}
    return V
Edytuj i uruchom kod