Определение функции эпсилон-жадного выбора
В обучении с подкреплением стратегия эпсилон-жадного выбора обеспечивает баланс между исследованием и эксплуатацией среды. Этот метод выбирает случайное действие с вероятностью epsilon, а наилучшее известное действие — с вероятностью 1-epsilon. Реализация функции epsilon_greedy() необходима для таких алгоритмов, как Q-обучение и SARSA: она помогает агенту обучаться, сочетая исследование среды и использование уже известных вознаграждений. Именно это и станет целью данного упражнения.
Библиотека numpy импортирована как np.
Это упражнение является частью курса
Обучение с подкреплением с Gymnasium на Python
Инструкции к упражнению
- Внутри функции напишите подходящее условие для исследования агентом окружающей среды.
- При исследовании выберите случайное
action. - При эксплуатации выберите наилучшее
actionсогласноq_table.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
epsilon = 0.2
env = gym.make('FrozenLake')
q_table = np.random.rand(env.observation_space.n, env.action_space.n)
def epsilon_greedy(state):
# Implement the condition to explore
if ____ < ____:
# Choose a random action
action = ____
else:
# Choose the best action according to q_table
action = ____
return action