ÎncepețiÎncepe gratuit

Accelerarea inferenței în modelele cuantizate

Compania ta folosește de ceva timp un model Llama pentru chatbot-ul de servicii clienți, cu cuantizare activată. Una dintre cele mai frecvente reclamații primite este că botul răspunde foarte lent și, uneori, produce răspunsuri ciudate.

Suspecți că problema ar putea fi legată de cuantizarea la 4 biți fără normalizare. În urma investigației, bănuiești și că scăderea vitezei provine din calculele de inferență, care folosesc valori float de 32 de biți.

Vrei să ajustezi configurațiile de cuantizare pentru a îmbunătăți viteza de inferență a modelului. Următoarele importuri au fost deja încărcate: AutoModelForCausalLM, AutoTokenizer și BitsAndBytesConfig.

Acest exercițiu face parte din cursul

Fine-Tuning cu Llama 3

Vezi cursul

Instrucțiuni pentru exercițiu

  • Setează tipul de cuantizare la float de 4 biți normalizat pentru a reduce valorile aberante și, astfel, a obține răspunsuri mai coerente.
  • Setează tipul de calcul la bfloat16 pentru a accelera viteza de calcul în timpul inferenței.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

bnb_config = BitsAndBytesConfig(
    load_in_4bit=True,
  	# Set quantization type to normalized 4-bit
    ____=____,
  	# Set compute data type to be bfloat16
    ____=____
)
model = AutoModelForCausalLM.from_pretrained(
    "Maykeye/TinyLLama-v0",
    quantization_config=bnb_config,
    low_cpu_mem_usage=True
)
Editează și rulează codul