Začněte nyníZačněte zdarma

Definice funkce epsilon-greedy

V RL představuje strategie epsilon-greedy rovnováhu mezi průzkumem a využíváním znalostí. Tato metoda vybírá náhodnou akci s pravděpodobností epsilon a nejlepší dosud známou akci s pravděpodobností 1–epsilon. Implementace funkce epsilon_greedy() je klíčová pro algoritmy jako Q-learning a SARSA — zajišťuje, že agent prostředí zároveň prozkoumává i využívá získané znalosti. Právě to bude cílem tohoto cvičení.

Knihovna numpy je naimportována jako np.

Toto cvičení je součástí kurzu

Reinforcement Learning with Gymnasium in Python

Zobrazit kurz

Pokyny k cvičení

  • Uvnitř funkce napiš podmínku, při které agent prostředí prozkoumává.
  • Při průzkumu vyber náhodnou action.
  • Při využívání znalostí vyber nejlepší action podle q_table.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

epsilon = 0.2
env = gym.make('FrozenLake')
q_table = np.random.rand(env.observation_space.n, env.action_space.n)

def epsilon_greedy(state):
    # Implement the condition to explore
    if ____ < ____:
      	# Choose a random action
        action = ____
    else:
      	# Choose the best action according to q_table
        action = ____
    return action
Upravit a spustit kód