ÎncepețiÎncepe gratuit

Definirea unei politici deterministe

În acest exercițiu, vei lucra cu un mediu personalizat numit MyGridWorld, același pe care l-ai văzut în videoclip. Acest mediu este o lume tip grilă în care agentul trebuie să ajungă la diamant cât mai repede posibil. Sarcina ta este să definești o politică care să ghideze comportamentul agentului, conform figurii de mai jos.

Image showing the policy: 
states 0, 1, 6, 7 - action right. 
states 2, 3 - action down. 
states 4, 5 - action left.

Acțiunile sunt reprezentate astfel: (0 → stânga, 1 → jos, 2 → dreapta, 3 → sus).

Biblioteca gymnasium a fost importată pentru tine ca gym, împreună cu funcția render().

Acest exercițiu face parte din cursul

Reinforcement Learning cu Gymnasium în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create the environment
env = ____
state, info = env.reset()

# Define the policy
policy = ____
Editează și rulează codul