Övergångssannolikheter och belöningar
Cliff Walking-miljön har 48 tillstånd, numrerade från 0 till 47, rad för rad, från det övre vänstra hörnet (0) till det nedre högra hörnet (47). Målet är att undersöka strukturen hos övergångssannolikheter och belöningar i den här miljön. Notera att alla belöningar är negativa – även belöningen för att nå målet. Det är ett medvetet designval som betonar vikten av att minimera antalet steg, eftersom varje steg medför en straffpoäng. Effektivitet är alltså centralt när du utformar fungerande inlärningsalgoritmer.
Gymnasium-biblioteket har importerats som gym och miljön som env. Även num_states och num_actions från föregående övning har importerats.

Den här övningen är en del av kursen
Reinforcement Learning med Gymnasium i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Choose the state
state = ____
# Extract transitions for each state-action pair
for action in range(num_actions):
transitions = ____
# Print details of each transition
for transition in transitions:
____, ____, ____, ____ = transition
print(f"Probability: {probability}, Next State: {next_state}, Reward: {reward}, Done: {done}")