Řešení prostředí CliffWalking pomocí epsilon-greedy strategie
Prostředí CliffWalking je klasická testovací úloha pro RL algoritmy. Jde o mřížkový svět, ve kterém musí agent najít cestu z počátečního stavu do cílového a přitom se vyhnout útesům. Epsilon-greedy strategie agentovi umožňuje efektivně prozkoumávat prostředí a zároveň se učit útesům vyhýbat, čímž maximalizuje kumulativní odměnu. Tvým úkolem je vyřešit toto prostředí pomocí epsilon-greedy strategie, vypočítat odměny získané v každé trénovací epizodě a uložit je do seznamu rewards_eps_greedy.
Toto cvičení je součástí kurzu
Reinforcement Learning with Gymnasium in Python
Pokyny k cvičení
- V rámci epizody vyber
actionpomocí funkceepsilon_greedy(). - Přičítej obdrženou
rewardkepisode_reward. - Po každé epizodě přidej celkovou
episode_rewarddo seznamurewards_eps_greedypro pozdější analýzu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
rewards_eps_greedy = []
for episode in range(total_episodes):
state, info = env.reset()
episode_reward = 0
for i in range(max_steps):
# Select action with epsilon-greedy strategy
action = ____
next_state, reward, terminated, truncated, info = env.step(action)
# Accumulate reward
____
update_q_table(state, action, reward, next_state)
state = next_state
# Append the toal reward to the rewards list
____
print("Average reward per episode: ", np.mean(rewards_eps_greedy))