เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การโหลดโมเดลแบบ 8-bit

บริษัทของคุณใช้โมเดล Llama สำหรับแชทบอตบริการลูกค้ามาสักระยะแล้ว และคุณได้รับมอบหมายให้หาวิธีลดการใช้หน่วยความจำ GPU ของโมเดลโดยไม่กระทบต่อประสิทธิภาพมากนัก ซึ่งจะช่วยให้ทีมสามารถเปลี่ยนไปใช้ compute cluster ราคาถูกกว่าและประหยัดค่าใช้จ่ายได้อย่างมาก

คุณจึงตัดสินใจทดสอบว่าสามารถโหลดโมเดลด้วย quantization แบบ 8-bit และยังคงประสิทธิภาพในระดับที่ยอมรับได้หรือไม่

โมเดลถูกกำหนดไว้ในตัวแปร model_name และมีการ import AutoModelForCausalLM กับ AutoTokenizer ให้แล้ว

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Fine-Tuning กับ Llama 3

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import คลาสการตั้งค่าที่ใช้เปิดใช้งานการโหลดโมเดลด้วย quantization
  • สร้าง instance ของคลาสการตั้งค่า quantization
  • กำหนดพารามิเตอร์ quantization เพื่อโหลดโมเดลแบบ 8-bit
  • ส่งการตั้งค่า quantization ไปยัง AutoModelForCausalLM เพื่อโหลดโมเดลที่ผ่านการ quantize แล้ว

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import quantization configuration class
from ____ import ____
# Instantiate quantization configuration
bnb_config = ____(
	# Set 8-bit loading
	____=True,
)
model = AutoModelForCausalLM.from_pretrained(
    "Maykeye/TinyLLama-v0",
  	# Set quantization parameters to load quantized model
    ____=bnb_config,
    low_cpu_mem_usage=True
)
แก้ไขและรันโค้ด