or
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
จะได้เรียนรู้การเตรียมข้อมูลสำหรับ distributed training โดยการแบ่งข้อมูลไปยังหลายอุปกรณ์และคัดลอกโมเดลไปไว้บนแต่ละอุปกรณ์ Accelerator มีอินเทอร์เฟซที่ใช้งานสะดวกสำหรับการเตรียมข้อมูล และจะได้เรียนรู้การ preprocess ภาพ เสียง และข้อความ ในฐานะขั้นตอนแรกของ distributed training
ใน distributed training แต่ละอุปกรณ์จะเทรนบนข้อมูลของตัวเองแบบขนาน จะได้สำรวจ 2 วิธีสำหรับ distributed training ได้แก่ Accelerator ที่รองรับ training loop แบบกำหนดเองได้ และ Trainer ที่ทำให้ขั้นตอนการเทรนง่ายขึ้น
Distributed training ต้องใช้ทรัพยากรสูงเมื่อทำงานกับโมเดลและชุดข้อมูลขนาดใหญ่ แต่สามารถรับมือกับความท้าทายเหล่านี้ได้ด้วยการปรับปรุงการใช้หน่วยความจำ การสื่อสารระหว่างอุปกรณ์ และประสิทธิภาพการคำนวณ จะได้เรียนรู้เทคนิค gradient accumulation, gradient checkpointing, local stochastic gradient descent, และ mixed precision training
จะได้เจาะลึก optimizer ในฐานะเครื่องมือสำคัญสำหรับเพิ่มประสิทธิภาพ distributed training พร้อมวิเคราะห์ข้อดีข้อเสียระหว่าง AdamW, Adafactor, และ 8-bit Adam นอกจากนี้ยังได้เรียนรู้ว่าการลดจำนวน parameter หรือการใช้ความแม่นยำต่ำช่วยลด memory footprint ของโมเดลได้อย่างไร
แบบฝึกหัดปัจจุบัน