or
Bài tập này là một phần của khóa học
Bạn sẽ chuẩn bị dữ liệu cho huấn luyện phân tán bằng cách chia dữ liệu cho nhiều thiết bị và sao chép mô hình lên mỗi thiết bị. Accelerator cung cấp giao diện tiện lợi để chuẩn bị dữ liệu, và bạn sẽ học cách tiền xử lý ảnh, âm thanh, và văn bản như bước đầu tiên của huấn luyện phân tán.
Trong huấn luyện phân tán, mỗi thiết bị huấn luyện song song trên phần dữ liệu của nó. Bạn sẽ tìm hiểu hai phương pháp để huấn luyện phân tán: Accelerator cho phép bạn viết vòng lặp huấn luyện tùy chỉnh, còn Trainer đơn giản hóa giao diện huấn luyện.
Huấn luyện phân tán có thể gây áp lực lên tài nguyên với mô hình và bộ dữ liệu lớn, nhưng bạn có thể giải quyết bằng cách cải thiện sử dụng bộ nhớ, giao tiếp giữa thiết bị, và hiệu quả tính toán. Bạn sẽ khám phá các kỹ thuật tích lũy gradient, gradient checkpointing, local stochastic gradient descent, và huấn luyện độ chính xác hỗn hợp (mixed precision).
Bạn sẽ tập trung vào các bộ tối ưu (optimizer) như các đòn bẩy để cải thiện hiệu quả huấn luyện phân tán, làm rõ đánh đổi giữa AdamW, Adafactor, và 8-bit Adam. Giảm số lượng tham số hoặc dùng độ chính xác thấp giúp giảm mức sử dụng bộ nhớ của mô hình.
Bài tập hiện tại