เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

เพิ่มความเร็ว inference ในโมเดลที่ผ่านการ quantize

บริษัทของคุณใช้โมเดล Llama สำหรับแชทบอตบริการลูกค้ามาระยะหนึ่งแล้ว โดยใช้งานร่วมกับ quantization แต่ปัญหาที่ลูกค้าร้องเรียนมากที่สุดคือบอตตอบคำถามช้ามาก และบางครั้งให้คำตอบที่ไม่สมเหตุสมผล

คุณสงสัยว่าปัญหานี้อาจเกิดจากการ quantize เป็น 4-bit โดยไม่มีการ normalize และเชื่อว่าปัญหาด้านความเร็วมาจากการคำนวณ inference ที่ยังใช้ float 32-bit อยู่

ดังนั้นจึงต้องการปรับค่าคอนฟิก quantization เพื่อเพิ่มความเร็วในการ inference โดย import ต่อไปนี้ถูกโหลดไว้แล้ว: AutoModelForCausalLM, AutoTokenizer และ BitsAndBytesConfig

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Fine-Tuning กับ Llama 3

ดูคอร์ส

คำแนะนำการฝึกหัด

  • กำหนดประเภท quantization เป็น normalized 4-bit เพื่อลด outlier และช่วยให้โมเดลให้คำตอบที่สมเหตุสมผลมากขึ้น
  • กำหนด compute type เป็น bfloat16 เพื่อเพิ่มความเร็วในการคำนวณ inference

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

bnb_config = BitsAndBytesConfig(
    load_in_4bit=True,
  	# Set quantization type to normalized 4-bit
    ____=____,
  	# Set compute data type to be bfloat16
    ____=____
)
model = AutoModelForCausalLM.from_pretrained(
    "Maykeye/TinyLLama-v0",
    quantization_config=bnb_config,
    low_cpu_mem_usage=True
)
แก้ไขและรันโค้ด