Kom igångKom igång gratis

Definiera en deterministisk policy

I den här övningen arbetar du med en anpassad miljö kallad MyGridWorld, samma miljö som visades i videon. Det är en rutnätsvärld där agentens mål är att nå diamanten så snabbt som möjligt. Din uppgift är att definiera en policy som styr agentens beteende enligt figuren nedan.

Image showing the policy: 
states 0, 1, 6, 7 - action right. 
states 2, 3 - action down. 
states 4, 5 - action left.

Aktioner representeras som: (0 → vänster, 1 → ner, 2 → höger, 3 → upp).

Biblioteket gymnasium har importerats åt dig som gym, tillsammans med funktionen render().

Den här övningen är en del av kursen

Reinforcement Learning med Gymnasium i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create the environment
env = ____
state, info = env.reset()

# Define the policy
policy = ____
Redigera och kör kod