Definice funkce epsilon-greedy
V RL představuje strategie epsilon-greedy rovnováhu mezi průzkumem a využíváním znalostí. Tato metoda vybírá náhodnou akci s pravděpodobností epsilon a nejlepší dosud známou akci s pravděpodobností 1–epsilon. Implementace funkce epsilon_greedy() je klíčová pro algoritmy jako Q-learning a SARSA — zajišťuje, že agent prostředí zároveň prozkoumává i využívá získané znalosti. Právě to bude cílem tohoto cvičení.
Knihovna numpy je naimportována jako np.
Toto cvičení je součástí kurzu
Reinforcement Learning with Gymnasium in Python
Pokyny k cvičení
- Uvnitř funkce napiš podmínku, při které agent prostředí prozkoumává.
- Při průzkumu vyber náhodnou
action. - Při využívání znalostí vyber nejlepší
actionpodleq_table.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
epsilon = 0.2
env = gym.make('FrozenLake')
q_table = np.random.rand(env.observation_space.n, env.action_space.n)
def epsilon_greedy(state):
# Implement the condition to explore
if ____ < ____:
# Choose a random action
action = ____
else:
# Choose the best action according to q_table
action = ____
return action