1. Learn
  2. /
  3. Курси
  4. /
  5. Глибоке навчання з підкріпленням у Python

Connected

Вправа

Навчання алгоритму PPO

Тепер ви використаєте знайомий цикл навчання A2C, щоб навчити алгоритм PPO.

Цей цикл навчання не повністю використовує переваги обрізаної замісної цільової функції, тож у результаті алгоритм не має працювати значно краще за A2C. Він слугує ілюстрацією понять, які ви вивчили щодо обрізаної замісної цілі та бонусу за ентропію.

Інструкції

100 XP
  • Приберіть бонус за ентропію з loss-функції актора, використавши значення 0.01 для параметра \(c_{entropy}\).