शुरू करेंमुफ़्त में शुरू करें

क्वांटाइज़्ड मॉडल में इन्फरेंस तेज़ करना

आपकी कंपनी ग्राहक सेवा चैटबॉट के लिए क्वांटाइज़ेशन के साथ एक Llama मॉडल का काफ़ी समय से उपयोग कर रही है। आपको मिलने वाली सबसे बड़ी शिकायतों में से एक है कि बॉट बहुत धीमे उत्तर देता है और कभी-कभी अजीब से जवाब दे देता है.

आपको संदेह है कि यह 4-bit में बिना normalization के क्वांटाइज़ करने से जुड़ा हो सकता है। अपनी जाँच में, आपको यह भी लगता है कि स्पीड का समझौता इन्फरेंस computations से आ रहा है, जो 32-bit floats पर चल रहे हैं.

आप अपने मॉडल की इन्फरेंस स्पीड बेहतर करने के लिए क्वांटाइज़ेशन कॉन्फ़िगरेशन समायोजित करना चाहते हैं। निम्नलिखित इम्पोर्ट पहले से लोड हैं: AutoModelForCausalLM, AutoTokenizer, और BitsAndBytesConfig.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Llama 3 के साथ फाइन-ट्यूनिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • outliers कम करने के लिए क्वांटाइज़ेशन टाइप को normalized 4-bit पर सेट करें, ताकि बे-सिर-पैर वाले जवाब कम आएँ.
  • compute टाइप को bfloat16 पर सेट करें, ताकि इन्फरेंस computations की स्पीड बढ़े.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

bnb_config = BitsAndBytesConfig(
    load_in_4bit=True,
  	# Set quantization type to normalized 4-bit
    ____=____,
  	# Set compute data type to be bfloat16
    ____=____
)
model = AutoModelForCausalLM.from_pretrained(
    "Maykeye/TinyLLama-v0",
    quantization_config=bnb_config,
    low_cpu_mem_usage=True
)
कोड संपादित करें और चलाएँ