Tải mô hình 8-bit
Công ty bạn đã dùng một mô hình Llama cho chatbot chăm sóc khách hàng được một thời gian. Bạn được giao nhiệm vụ tìm cách giảm mức dùng bộ nhớ GPU của mô hình mà không ảnh hưởng đáng kể đến hiệu năng. Việc này sẽ cho phép nhóm chuyển sang cụm tính toán rẻ hơn và tiết kiệm nhiều chi phí cho công ty.
Bạn quyết định thử tải mô hình với lượng tử hóa 8-bit và xem liệu có thể giữ hiệu năng ở mức chấp nhận được không.
Bạn được cung cấp mô hình trong model_name. AutoModelForCausalLM và AutoTokenizer đã được nhập sẵn cho bạn.
Bài tập này là một phần của khóa học
Fine-Tuning với Llama 3
Hướng dẫn bài tập
- Import lớp cấu hình để bật khả năng tải mô hình với lượng tử hóa.
- Khởi tạo đối tượng cấu hình lượng tử hóa.
- Thiết lập tham số lượng tử hóa để tải mô hình ở dạng 8-bit.
- Truyền cấu hình lượng tử hóa vào
AutoModelForCausalLMđể tải mô hình đã được lượng tử hóa.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import quantization configuration class
from ____ import ____
# Instantiate quantization configuration
bnb_config = ____(
# Set 8-bit loading
____=True,
)
model = AutoModelForCausalLM.from_pretrained(
"Maykeye/TinyLLama-v0",
# Set quantization parameters to load quantized model
____=bnb_config,
low_cpu_mem_usage=True
)