Definirea unei politici deterministe
În acest exercițiu, vei lucra cu un mediu personalizat numit MyGridWorld, același pe care l-ai văzut în videoclip. Acest mediu este o lume tip grilă în care agentul trebuie să ajungă la diamant cât mai repede posibil. Sarcina ta este să definești o politică care să ghideze comportamentul agentului, conform figurii de mai jos.

Acțiunile sunt reprezentate astfel: (0 → stânga, 1 → jos, 2 → dreapta, 3 → sus).
Biblioteca gymnasium a fost importată pentru tine ca gym, împreună cu funcția render().
Acest exercițiu face parte din cursul
Reinforcement Learning cu Gymnasium în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create the environment
env = ____
state, info = env.reset()
# Define the policy
policy = ____