Definiera en deterministisk policy
I den här övningen arbetar du med en anpassad miljö kallad MyGridWorld, samma miljö som visades i videon. Det är en rutnätsvärld där agentens mål är att nå diamanten så snabbt som möjligt. Din uppgift är att definiera en policy som styr agentens beteende enligt figuren nedan.

Aktioner representeras som: (0 → vänster, 1 → ner, 2 → höger, 3 → upp).
Biblioteket gymnasium har importerats åt dig som gym, tillsammans med funktionen render().
Den här övningen är en del av kursen
Reinforcement Learning med Gymnasium i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create the environment
env = ____
state, info = env.reset()
# Define the policy
policy = ____