Obliczanie wartości Q
Twoim celem jest obliczenie wartości akcji, zwanych wartościami Q, dla każdej pary stan-akcja w niestandardowym środowisku MyGridWorld przy zastosowaniu poniższej polityki. W uczeniu ze wzmocnieniem wartości Q są kluczowe – reprezentują oczekiwaną użyteczność wykonania określonej akcji w danym stanie, po której agent postępuje zgodnie z polityką.

Środowisko zostało zaimportowane jako env wraz z funkcją compute_state_value() oraz niezbędnymi zmiennymi (terminal_state, num_states, num_actions, policy, gamma).
To ćwiczenie jest częścią kursu
Uczenie przez wzmacnianie z Gymnasium w Pythonie
Instrukcje do ćwiczenia
- Uzupełnij funkcję
compute_q_value(), aby obliczała wartość akcji dla podanego stanustatei akcjiaction. - Utwórz słownik
Q, w którym każdy klucz reprezentuje parę stan-akcja, a odpowiadająca mu wartość to wartość Q dla tej pary.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Complete the function to compute the action-value for a state-action pair
def compute_q_value(state, action):
if state == terminal_state:
return None
probability, next_state, reward, done = ____
return ____
# Compute Q-values for each state-action pair
Q = {(____, ____): _____ for ____ in range(____) for ____ in range(____)}
print(Q)