8-बिट मॉडल लोड करना
आपकी कंपनी कस्टमर सर्विस चैटबॉट के लिए काफी समय से Llama मॉडल इस्तेमाल कर रही है. आपको यह जाँचने का काम मिला है कि प्रदर्शन पर बहुत असर डाले बिना मॉडल की GPU मेमोरी उपयोग कैसे घटाया जाए. इससे टीम सस्ते कंप्यूट क्लस्टर पर स्विच कर पाएगी और कंपनी की अच्छी-खासी बचत होगी.
आप यह टेस्ट करने का फैसला करते हैं कि क्या आप अपने मॉडल को 8-बिट क्वांटाइजेशन के साथ लोड करके उचित प्रदर्शन बनाए रख सकते हैं.
आपको मॉडल model_name में दिया गया है. AutoModelForCausalLM और AutoTokenizer पहले से आपके लिए इम्पोर्ट किए गए हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Llama 3 के साथ फाइन-ट्यूनिंग
अभ्यास निर्देश
- क्वांटाइजेशन के साथ मॉडल लोड करने में सक्षम बनाने के लिए कॉन्फ़िगरेशन क्लास इम्पोर्ट करें.
- क्वांटाइजेशन कॉन्फ़िगरेशन क्लास का इंस्टेंस बनाएँ.
- मॉडल को 8-बिट में लोड करने के लिए क्वांटाइजेशन पैरामीटर्स कॉन्फ़िगर करें.
- क्वांटाइज्ड मॉडल लोड करने हेतु
AutoModelForCausalLMको क्वांटाइजेशन कॉन्फ़िगरेशन पास करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import quantization configuration class
from ____ import ____
# Instantiate quantization configuration
bnb_config = ____(
# Set 8-bit loading
____=True,
)
model = AutoModelForCausalLM.from_pretrained(
"Maykeye/TinyLLama-v0",
# Set quantization parameters to load quantized model
____=bnb_config,
low_cpu_mem_usage=True
)