Kom igångKom igång gratis

Övergångssannolikheter och belöningar

Cliff Walking-miljön har 48 tillstånd, numrerade från 0 till 47, rad för rad, från det övre vänstra hörnet (0) till det nedre högra hörnet (47). Målet är att undersöka strukturen hos övergångssannolikheter och belöningar i den här miljön. Notera att alla belöningar är negativa – även belöningen för att nå målet. Det är ett medvetet designval som betonar vikten av att minimera antalet steg, eftersom varje steg medför en straffpoäng. Effektivitet är alltså centralt när du utformar fungerande inlärningsalgoritmer.

Gymnasium-biblioteket har importerats som gym och miljön som env. Även num_states och num_actions från föregående övning har importerats.

Image showing the cliff walking environment.

Den här övningen är en del av kursen

Reinforcement Learning med Gymnasium i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Choose the state
state = ____

# Extract transitions for each state-action pair
for action in range(num_actions):
    transitions = ____
    # Print details of each transition
    for transition in transitions:
        ____, ____, ____, ____ = transition
        print(f"Probability: {probability}, Next State: {next_state}, Reward: {reward}, Done: {done}")
Redigera och kör kod