Accelerarea inferenței în modelele cuantizate
Compania ta folosește de ceva timp un model Llama pentru chatbot-ul de servicii clienți, cu cuantizare activată. Una dintre cele mai frecvente reclamații primite este că botul răspunde foarte lent și, uneori, produce răspunsuri ciudate.
Suspecți că problema ar putea fi legată de cuantizarea la 4 biți fără normalizare. În urma investigației, bănuiești și că scăderea vitezei provine din calculele de inferență, care folosesc valori float de 32 de biți.
Vrei să ajustezi configurațiile de cuantizare pentru a îmbunătăți viteza de inferență a modelului. Următoarele importuri au fost deja încărcate: AutoModelForCausalLM, AutoTokenizer și BitsAndBytesConfig.
Acest exercițiu face parte din cursul
Fine-Tuning cu Llama 3
Instrucțiuni pentru exercițiu
- Setează tipul de cuantizare la float de 4 biți normalizat pentru a reduce valorile aberante și, astfel, a obține răspunsuri mai coerente.
- Setează tipul de calcul la bfloat16 pentru a accelera viteza de calcul în timpul inferenței.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
bnb_config = BitsAndBytesConfig(
load_in_4bit=True,
# Set quantization type to normalized 4-bit
____=____,
# Set compute data type to be bfloat16
____=____
)
model = AutoModelForCausalLM.from_pretrained(
"Maykeye/TinyLLama-v0",
quantization_config=bnb_config,
low_cpu_mem_usage=True
)