Začněte nyníZačněte zdarma

Řešení prostředí CliffWalking pomocí epsilon-greedy strategie

Prostředí CliffWalking je klasická testovací úloha pro RL algoritmy. Jde o mřížkový svět, ve kterém musí agent najít cestu z počátečního stavu do cílového a přitom se vyhnout útesům. Epsilon-greedy strategie agentovi umožňuje efektivně prozkoumávat prostředí a zároveň se učit útesům vyhýbat, čímž maximalizuje kumulativní odměnu. Tvým úkolem je vyřešit toto prostředí pomocí epsilon-greedy strategie, vypočítat odměny získané v každé trénovací epizodě a uložit je do seznamu rewards_eps_greedy.

Toto cvičení je součástí kurzu

Reinforcement Learning with Gymnasium in Python

Zobrazit kurz

Pokyny k cvičení

  • V rámci epizody vyber action pomocí funkce epsilon_greedy().
  • Přičítej obdrženou reward k episode_reward.
  • Po každé epizodě přidej celkovou episode_reward do seznamu rewards_eps_greedy pro pozdější analýzu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

rewards_eps_greedy = []
for episode in range(total_episodes):
    state, info = env.reset()
    episode_reward = 0
    for i in range(max_steps):
      	# Select action with epsilon-greedy strategy
        action = ____
        next_state, reward, terminated, truncated, info = env.step(action)
        # Accumulate reward
        ____        
        update_q_table(state, action, reward, next_state)      
        state = next_state
    # Append the toal reward to the rewards list 
    ____
print("Average reward per episode: ", np.mean(rewards_eps_greedy))
Upravit a spustit kód