Prawdopodobieństwa przejść i nagrody
Środowisko Cliff Walking składa się z 48 stanów, ponumerowanych od 0 do 47, wiersz po wierszu, od lewego górnego rogu (0) do prawego dolnego rogu (47). Twoim zadaniem jest zbadanie struktury prawdopodobieństw przejść i nagród w tym środowisku. Warto zwrócić uwagę, że wszystkie nagrody – w tym nagroda za dotarcie do celu – są ujemne. Taki projekt środowiska kładzie nacisk na minimalizowanie liczby kroków, ponieważ każdy krok wiąże się z karą. Sprawia to, że efektywność działania agenta staje się kluczowym elementem przy projektowaniu skutecznych algorytmów uczenia.
Biblioteka gymnasium została zaimportowana jako gym, a środowisko jako env. Zaimportowano też num_states i num_actions z poprzedniego ćwiczenia.

To ćwiczenie jest częścią kursu
Uczenie przez wzmacnianie z Gymnasium w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Choose the state
state = ____
# Extract transitions for each state-action pair
for action in range(num_actions):
transitions = ____
# Print details of each transition
for transition in transitions:
____, ____, ____, ____ = transition
print(f"Probability: {probability}, Next State: {next_state}, Reward: {reward}, Done: {done}")