ÎncepețiÎncepe gratuit

Probabilități de tranziție și recompense

Mediul Cliff Walking are 48 de stări, numerotate de la 0 la 47, linie cu linie, din colțul din stânga sus (0) până în colțul din dreapta jos (47). Obiectivul tău este să explorezi structura probabilităților de tranziție și a recompenselor în cadrul acestui mediu. De remarcat că toate recompensele sunt negative în acest mediu, inclusiv recompensa pentru atingerea obiectivului. Această alegere de design pune accentul pe minimizarea numărului de pași, deoarece fiecare pas implică o penalizare – eficiența devine astfel un element esențial în proiectarea algoritmilor de învățare eficienți.

Biblioteca gymnasium a fost importată ca gym, iar mediul ca env. De asemenea, num_states și num_actions din exercițiul anterior au fost importate.

Image showing the cliff walking environment.

Acest exercițiu face parte din cursul

Reinforcement Learning cu Gymnasium în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Choose the state
state = ____

# Extract transitions for each state-action pair
for action in range(num_actions):
    transitions = ____
    # Print details of each transition
    for transition in transitions:
        ____, ____, ____, ____ = transition
        print(f"Probability: {probability}, Next State: {next_state}, Reward: {reward}, Done: {done}")
Editează și rulează codul