НачатьНачать бесплатно

Определение функции эпсилон-жадного выбора

В обучении с подкреплением стратегия эпсилон-жадного выбора обеспечивает баланс между исследованием и эксплуатацией среды. Этот метод выбирает случайное действие с вероятностью epsilon, а наилучшее известное действие — с вероятностью 1-epsilon. Реализация функции epsilon_greedy() необходима для таких алгоритмов, как Q-обучение и SARSA: она помогает агенту обучаться, сочетая исследование среды и использование уже известных вознаграждений. Именно это и станет целью данного упражнения.

Библиотека numpy импортирована как np.

Это упражнение является частью курса

Обучение с подкреплением с Gymnasium на Python

Посмотреть курс

Инструкции к упражнению

  • Внутри функции напишите подходящее условие для исследования агентом окружающей среды.
  • При исследовании выберите случайное action.
  • При эксплуатации выберите наилучшее action согласно q_table.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

epsilon = 0.2
env = gym.make('FrozenLake')
q_table = np.random.rand(env.observation_space.n, env.action_space.n)

def epsilon_greedy(state):
    # Implement the condition to explore
    if ____ < ____:
      	# Choose a random action
        action = ____
    else:
      	# Choose the best action according to q_table
        action = ____
    return action
Редактировать и запускать код