or
この演習はコースの一部です
複数のデバイスにデータを分割し、各デバイスにモデルをコピーすることで、分散トレーニングに向けたデータ準備を行います。Accelerator はデータ準備のための便利なインターフェースを提供しており、分散トレーニングの第一歩として、画像・音声・テキストの前処理方法を学びます。
分散トレーニングでは、各デバイスが並列にデータをトレーニングします。Accelerator によるカスタムトレーニングループと、よりシンプルなインターフェースを提供する Trainer という、2 つの分散トレーニング手法を学びましょう。
大規模なモデルやデータセットを扱う分散トレーニングは、リソースに大きな負荷をかけます。メモリ使用量、デバイス間通信、計算効率を改善することで、こうした課題に対処できます。勾配累積、勾配チェックポインティング、局所的確率的勾配降下法、混合精度トレーニングといった技術を学びましょう。
現在の演習
分散トレーニングの効率を高める手段としてオプティマイザーに注目し、AdamW、Adafactor、8-bit Adam のトレードオフを明らかにします。パラメータ数の削減や低精度の活用により、モデルのメモリ使用量を抑える方法も学びます。