เพิ่มความเร็ว inference ในโมเดลที่ผ่านการ quantize
บริษัทของคุณใช้โมเดล Llama สำหรับแชทบอตบริการลูกค้ามาระยะหนึ่งแล้ว โดยใช้งานร่วมกับ quantization แต่ปัญหาที่ลูกค้าร้องเรียนมากที่สุดคือบอตตอบคำถามช้ามาก และบางครั้งให้คำตอบที่ไม่สมเหตุสมผล
คุณสงสัยว่าปัญหานี้อาจเกิดจากการ quantize เป็น 4-bit โดยไม่มีการ normalize และเชื่อว่าปัญหาด้านความเร็วมาจากการคำนวณ inference ที่ยังใช้ float 32-bit อยู่
ดังนั้นจึงต้องการปรับค่าคอนฟิก quantization เพื่อเพิ่มความเร็วในการ inference โดย import ต่อไปนี้ถูกโหลดไว้แล้ว: AutoModelForCausalLM, AutoTokenizer และ BitsAndBytesConfig
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Fine-Tuning กับ Llama 3
คำแนะนำการฝึกหัด
- กำหนดประเภท quantization เป็น normalized 4-bit เพื่อลด outlier และช่วยให้โมเดลให้คำตอบที่สมเหตุสมผลมากขึ้น
- กำหนด compute type เป็น bfloat16 เพื่อเพิ่มความเร็วในการคำนวณ inference
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
bnb_config = BitsAndBytesConfig(
load_in_4bit=True,
# Set quantization type to normalized 4-bit
____=____,
# Set compute data type to be bfloat16
____=____
)
model = AutoModelForCausalLM.from_pretrained(
"Maykeye/TinyLLama-v0",
quantization_config=bnb_config,
low_cpu_mem_usage=True
)