Ladda modeller med 8-bitars precision
Ditt företag har ett tag använt en Llama-modell i sin kundtjänstchattbot. Du har fått i uppgift att undersöka hur modellens GPU-minnesanvändning kan minskas utan att prestandan påverkas nämnvärt. Det skulle göra det möjligt för teamet att byta till ett billigare beräkningskluster och spara företaget mycket pengar.
Du bestämmer dig för att testa om du kan ladda modellen med 8-bitars kvantisering och ändå behålla rimlig prestanda.
Modellen finns tillgänglig i model_name. AutoModelForCausalLM och AutoTokenizer är redan importerade.
Den här övningen är en del av kursen
Finjustering med Llama 3
Övningsinstruktioner
- Importera konfigurationsklassen som möjliggör inläsning av modeller med kvantisering.
- Skapa en instans av kvantiseringskonfigurationsklassen.
- Konfigurera kvantiseringsparametrarna så att modellen laddas med 8-bitars precision.
- Skicka kvantiseringskonfigurationen till
AutoModelForCausalLMför att ladda den kvantiserade modellen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import quantization configuration class
from ____ import ____
# Instantiate quantization configuration
bnb_config = ____(
# Set 8-bit loading
____=True,
)
model = AutoModelForCausalLM.from_pretrained(
"Maykeye/TinyLLama-v0",
# Set quantization parameters to load quantized model
____=bnb_config,
low_cpu_mem_usage=True
)