ÎncepețiÎncepe gratuit

Evaluarea politicii pe un lac înghețat alunecos

Într-un mediu Frozen Lake alunecos, simpla deducere a politicii dintr-un tabel Q învățat nu este suficientă pentru a-i evalua eficiența. Pentru a aprecia corect calitatea unei politici învățate, trebuie să rulezi mai multe episoade și să observi recompensa medie obținută. Acest exercițiu compară eficiența politicii învățate cu o linie de referință stabilită prin urmarea unei politici aleatoare în timpul antrenamentului. Sarcina ta este să execuți politica învățată pe parcursul mai multor episoade și să îi analizezi performanța pe baza recompenselor medii colectate, comparând-o cu recompensele medii obținute în faza politicii aleatoare.

Tabelul Q Q, num_states, num_actions și avg_reward_per_random_episode au fost preîncărcate. Biblioteca NumPy a fost importată ca np.

Acest exercițiu face parte din cursul

Reinforcement Learning cu Gymnasium în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • La fiecare iterație, selectează cea mai bună acțiune de efectuat pe baza tabelului Q învățat Q.
  • Calculează recompensa medie per episod învățat avg_reward_per_learned_episode.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

for episode in range(10000):
    state, info = env.reset()
    terminated = False
    episode_reward = 0
    while not terminated:
        # Select the best action based on learned Q-table
        action = ____
        new_state, reward, terminated, truncated, info = env.step(action)
        state = new_state
        episode_reward += reward
    reward_per_learned_episode.append(episode_reward)
# Compute and print the average reward per learned episode
avg_reward_per_learned_episode = ____
print("Average reward per learned episode: ", avg_reward_per_learned_episode)
print("Average reward per random episode: ", ____)
Editează și rulează codul