Definiowanie deterministycznej polityki
W tym ćwiczeniu będziesz pracować z niestandardowym środowiskiem MyGridWorld – tym samym, które widziałeś w filmie. To środowisko to świat siatki, w którym celem agenta jest jak najszybsze dotarcie do diamentu. Twoim zadaniem jest zdefiniowanie polityki kierującej zachowaniem agenta zgodnie z rysunkiem poniżej.

Akcje są reprezentowane jako: (0 → lewo, 1 → dół, 2 → prawo, 3 → góra).
Biblioteka gymnasium została już zaimportowana jako gym wraz z funkcją render().
To ćwiczenie jest częścią kursu
Uczenie przez wzmacnianie z Gymnasium w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create the environment
env = ____
state, info = env.reset()
# Define the policy
policy = ____