Definování deterministické politiky
V tomto cvičení budeš pracovat s vlastním prostředím MyGridWorld, které jsi viděl/a ve videu. Jde o mřížkový svět, kde je cílem agenta dostat se co nejrychleji k diamantu. Tvým úkolem je definovat politiku, která řídí chování agenta podle obrázku níže.

Akce jsou reprezentovány takto: (0 → doleva, 1 → dolů, 2 → doprava, 3 → nahoru).
Knihovna gymnasium je pro tebe naimportována jako gym spolu s funkcí render().
Toto cvičení je součástí kurzu
Reinforcement Learning with Gymnasium in Python
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create the environment
env = ____
state, info = env.reset()
# Define the policy
policy = ____