Kom igångKom igång gratis

Beräkna Q-värden

Målet är att beräkna aktionsvärden, även kallade Q-värden, för varje tillstånd-åtgärdspar i den anpassade miljön MyGridWorld när du följer policyn nedan. Inom RL är Q-värden centrala eftersom de representerar det förväntade värdet av att utföra en specifik åtgärd i ett givet tillstånd, följt av fortsatt tillämpning av policyn.

exercise_policy.png

Miljön har importerats som env tillsammans med funktionen compute_state_value() och de nödvändiga variablerna (terminal_state, num_states, num_actions, policy, gamma).

Den här övningen är en del av kursen

Reinforcement Learning med Gymnasium i Python

Visa kurs

Övningsinstruktioner

  • Komplettera funktionen compute_q_value() för att beräkna aktionsvärdet för ett givet state och action.
  • Skapa en ordbok Q där varje nyckel representerar ett tillstånd-åtgärdspar och motsvarande värde är Q-värdet för det paret.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Complete the function to compute the action-value for a state-action pair
def compute_q_value(state, action):
    if state == terminal_state:
        return None   
    probability, next_state, reward, done = ____
    return ____

# Compute Q-values for each state-action pair
Q = {(____, ____): _____ for ____ in range(____) for ____ in range(____)}

print(Q)
Redigera och kör kod