Zastosowanie iteracji polityki do znalezienia optymalnej polityki
Iteracja polityki to podstawowa technika w uczeniu przez wzmacnianie (RL), służąca do wyznaczania optymalnej polityki. Składa się z dwóch głównych kroków: ewaluacji polityki, w której obliczasz funkcję wartości stanu dla danej polityki, oraz poprawy polityki, w której aktualizujesz politykę na podstawie tych wartości. Oba kroki będziesz stosować iteracyjnie, aż do osiągnięcia zbieżności do optymalnej polityki w niestandardowym środowisku MyGridWorld.
Do wyświetlania kroków podejmowanych przez agenta zgodnie z daną polityką służy funkcja render_policy().
Funkcje compute_state_value(state, policy) oraz compute_q_value(state, action, policy) zostały wcześniej załadowane.
To ćwiczenie jest częścią kursu
Uczenie przez wzmacnianie z Gymnasium w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Complete the policy evaluation function
def policy_evaluation(policy):
V = {____: ____ for ____ in range(____)}
return V