or
यह अभ्यास पाठ्यक्रम का हिस्सा है
आप distributed training के लिए डेटा तैयार करेंगे: डेटा को कई डिवाइसों में बाँटकर और हर डिवाइस पर मॉडल की कॉपी बनाकर। Accelerator डेटा तैयारी के लिए एक सुविधाजनक इंटरफ़ेस देता है, और आप distributed training के पहले चरण के रूप में इमेज, ऑडियो, और टेक्स्ट को preprocess करना सीखेंगे।
Distributed training में, हर डिवाइस अपने डेटा पर parallel रूप से ट्रेन करता है। आप distributed training के दो तरीकों की जाँच करेंगे: Accelerator custom training loops सक्षम करता है, और Trainer प्रशिक्षण के लिए इंटरफ़ेस को सरल बनाता है।
बड़े मॉडल और डेटासेट के साथ distributed training संसाधनों पर दबाव डालती है, लेकिन आप मेमोरी उपयोग, डिवाइस कम्युनिकेशन, और computational दक्षता को बेहतर बनाकर इन चुनौतियों से निपट सकते हैं। आप gradient accumulation, gradient checkpointing, local stochastic gradient descent, और mixed precision training की तकनीकों को जानेंगे।
आप optimizers पर ध्यान देंगे ताकि distributed training की efficiency बेहतर हो, और AdamW, Adafactor, तथा 8-bit Adam के बीच के trade-offs को समझेंगे। parameters की संख्या घटाना या low precision का उपयोग करना मॉडल की memory footprint को कम करने में मदद करता है।
वर्तमान अभ्यास