Začněte nyníZačněte zdarma

Definování deterministické politiky

V tomto cvičení budeš pracovat s vlastním prostředím MyGridWorld, které jsi viděl/a ve videu. Jde o mřížkový svět, kde je cílem agenta dostat se co nejrychleji k diamantu. Tvým úkolem je definovat politiku, která řídí chování agenta podle obrázku níže.

Image showing the policy: 
states 0, 1, 6, 7 - action right. 
states 2, 3 - action down. 
states 4, 5 - action left.

Akce jsou reprezentovány takto: (0 → doleva, 1 → dolů, 2 → doprava, 3 → nahoru).

Knihovna gymnasium je pro tebe naimportována jako gym spolu s funkcí render().

Toto cvičení je součástí kurzu

Reinforcement Learning with Gymnasium in Python

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create the environment
env = ____
state, info = env.reset()

# Define the policy
policy = ____
Upravit a spustit kód