or
Ця вправа є частиною курсу
Ви підготуєте дані для розподіленого тренування, розділивши їх між кількома пристроями та скопіювавши модель на кожен пристрій. Accelerator надає зручний інтерфейс для підготовки даних. Ви навчитеся попередньо обробляти зображення, аудіо та текст як перший крок у розподіленому тренуванні.
У розподіленому тренуванні кожен пристрій паралельно навчається на своїх даних. Ви розглянете два способи розподіленого тренування: Accelerator дає змогу створювати власні цикли тренування, а Trainer спрощує інтерфейс для навчання.
Розподілене тренування навантажує ресурси великими моделями та наборами даних, але ці виклики можна подолати, поліпшивши використання пам’яті, обмін даними між пристроями та обчислювальну ефективність. Ви ознайомитеся з прийомами акумулювання градієнтів, градієнтного контрольного збереження (gradient checkpointing), локального стохастичного градієнтного спуску та тренування зі змішаною точністю.
Ви зосередитеся на оптимізаторах як важелях підвищення ефективності розподіленого тренування, розглянувши компроміси між AdamW, Adafactor і 8-bit Adam. Зменшення кількості параметрів або використання низької точності допомагає скоротити обсяг пам’яті, потрібної моделі.
Поточна вправа