or
Den här övningen är en del av kursen
Du förbereder data för distribuerad träning genom att dela upp data över flera enheter och kopiera modellen på varje enhet. Accelerator erbjuder ett smidigt gränssnitt för dataförberedelse, och du lär dig att förbehandla bilder, ljud och text som ett första steg i distribuerad träning.
Vid distribuerad träning tränar varje enhet på sin del av data parallellt. Du undersöker två metoder för distribuerad träning: Accelerator möjliggör anpassade träningsloopar, medan Trainer förenklar gränssnittet för träning.
Distribuerad träning belastar resurser hårt med stora modeller och datamängder, men du kan hantera dessa utmaningar genom att förbättra minnesanvändning, enhetskommunikation och beräkningseffektivitet. Du lär dig teknikerna gradientackumulering, gradientkontrollpunkter, lokalt stokastiskt gradientnedsteg och träning med blandad precision.
Här fokuserar du på optimerare som verktyg för att förbättra effektiviteten vid distribuerad träning, med fokus på avvägningarna mellan AdamW, Adafactor och 8-bit Adam. Att minska antalet parametrar eller använda lägre precision bidrar till att minska modellens minneskrav.
Aktuell övning