or
本練習屬於課程
你將把資料分散到多個裝置,並在每個裝置上複製模型,以便進行分散式訓練。Accelerator 提供了便利的資料準備介面,你會先學會如何前處理影像、音訊與文字,作為分散式訓練的第一步。
當前練習
在分散式訓練中,每個裝置會並行地使用各自的資料進行訓練。你將探討兩種分散式訓練方法:使用 Accelerator 建立自訂訓練迴圈,以及用 Trainer 簡化訓練介面。
大型模型與資料集會使分散式訓練對資源造成壓力,但你可以透過改善記憶體使用、裝置間通訊與計算效率來因應這些挑戰。你將學會梯度累積、梯度檢查點、在地隨機梯度下降(local SGD),以及混合精度訓練等技巧。
你將把重點放在最佳化器,作為提升分散式訓練效率的槓桿,並比較 AdamW、Adafactor 與 8-bit Adam 的取捨。減少參數量或使用低精度都有助於降低模型的記憶體佔用。