Kom igångKom igång gratis

Ladda modeller med 8-bitars precision

Ditt företag har ett tag använt en Llama-modell i sin kundtjänstchattbot. Du har fått i uppgift att undersöka hur modellens GPU-minnesanvändning kan minskas utan att prestandan påverkas nämnvärt. Det skulle göra det möjligt för teamet att byta till ett billigare beräkningskluster och spara företaget mycket pengar.

Du bestämmer dig för att testa om du kan ladda modellen med 8-bitars kvantisering och ändå behålla rimlig prestanda.

Modellen finns tillgänglig i model_name. AutoModelForCausalLM och AutoTokenizer är redan importerade.

Den här övningen är en del av kursen

Finjustering med Llama 3

Visa kurs

Övningsinstruktioner

  • Importera konfigurationsklassen som möjliggör inläsning av modeller med kvantisering.
  • Skapa en instans av kvantiseringskonfigurationsklassen.
  • Konfigurera kvantiseringsparametrarna så att modellen laddas med 8-bitars precision.
  • Skicka kvantiseringskonfigurationen till AutoModelForCausalLM för att ladda den kvantiserade modellen.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import quantization configuration class
from ____ import ____
# Instantiate quantization configuration
bnb_config = ____(
	# Set 8-bit loading
	____=True,
)
model = AutoModelForCausalLM.from_pretrained(
    "Maykeye/TinyLLama-v0",
  	# Set quantization parameters to load quantized model
    ____=bnb_config,
    low_cpu_mem_usage=True
)
Redigera och kör kod