Zacznij terazZacznij za darmo

Definiowanie deterministycznej polityki

W tym ćwiczeniu będziesz pracować z niestandardowym środowiskiem MyGridWorld – tym samym, które widziałeś w filmie. To środowisko to świat siatki, w którym celem agenta jest jak najszybsze dotarcie do diamentu. Twoim zadaniem jest zdefiniowanie polityki kierującej zachowaniem agenta zgodnie z rysunkiem poniżej.

Image showing the policy: 
states 0, 1, 6, 7 - action right. 
states 2, 3 - action down. 
states 4, 5 - action left.

Akcje są reprezentowane jako: (0 → lewo, 1 → dół, 2 → prawo, 3 → góra).

Biblioteka gymnasium została już zaimportowana jako gym wraz z funkcją render().

To ćwiczenie jest częścią kursu

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create the environment
env = ____
state, info = env.reset()

# Define the policy
policy = ____
Edytuj i uruchom kod