Цикл взаимодействия в обучении с подкреплением
Как вы уже знаете, обучение с подкреплением предполагает, что агент принимает решения в среде, стремясь максимизировать накопленное вознаграждение. Агент должен самостоятельно выяснить, какие действия приносят наибольшую награду, — через взаимодействие со средой.
Это упражнение является частью курса
Обучение с подкреплением с Gymnasium на Python
Практическое интерактивное упражнение
Превратите теорию в практику с помощью одного из наших интерактивных упражнений
Начать упражнение