Zacznij terazZacznij za darmo

Prawdopodobieństwa przejść i nagrody

Środowisko Cliff Walking składa się z 48 stanów, ponumerowanych od 0 do 47, wiersz po wierszu, od lewego górnego rogu (0) do prawego dolnego rogu (47). Twoim zadaniem jest zbadanie struktury prawdopodobieństw przejść i nagród w tym środowisku. Warto zwrócić uwagę, że wszystkie nagrody – w tym nagroda za dotarcie do celu – są ujemne. Taki projekt środowiska kładzie nacisk na minimalizowanie liczby kroków, ponieważ każdy krok wiąże się z karą. Sprawia to, że efektywność działania agenta staje się kluczowym elementem przy projektowaniu skutecznych algorytmów uczenia.

Biblioteka gymnasium została zaimportowana jako gym, a środowisko jako env. Zaimportowano też num_states i num_actions z poprzedniego ćwiczenia.

Image showing the cliff walking environment.

To ćwiczenie jest częścią kursu

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Choose the state
state = ____

# Extract transitions for each state-action pair
for action in range(num_actions):
    transitions = ____
    # Print details of each transition
    for transition in transitions:
        ____, ____, ____, ____ = transition
        print(f"Probability: {probability}, Next State: {next_state}, Reward: {reward}, Done: {done}")
Edytuj i uruchom kod