Probabilități de tranziție și recompense
Mediul Cliff Walking are 48 de stări, numerotate de la 0 la 47, linie cu linie, din colțul din stânga sus (0) până în colțul din dreapta jos (47). Obiectivul tău este să explorezi structura probabilităților de tranziție și a recompenselor în cadrul acestui mediu. De remarcat că toate recompensele sunt negative în acest mediu, inclusiv recompensa pentru atingerea obiectivului. Această alegere de design pune accentul pe minimizarea numărului de pași, deoarece fiecare pas implică o penalizare – eficiența devine astfel un element esențial în proiectarea algoritmilor de învățare eficienți.
Biblioteca gymnasium a fost importată ca gym, iar mediul ca env. De asemenea, num_states și num_actions din exercițiul anterior au fost importate.

Acest exercițiu face parte din cursul
Reinforcement Learning cu Gymnasium în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Choose the state
state = ____
# Extract transitions for each state-action pair
for action in range(num_actions):
transitions = ____
# Print details of each transition
for transition in transitions:
____, ____, ____, ____ = transition
print(f"Probability: {probability}, Next State: {next_state}, Reward: {reward}, Done: {done}")