Snabbare inferens i kvantiserade modeller
Ditt företag har ett tag använt en Llama-modell för sin kundtjänstchattbot med kvantisering. Ett av de vanligaste klagomålen från kunderna är att boten svarar väldigt långsamt och ibland ger konstiga svar.
Du misstänker att det kan bero på kvantisering till 4-bitar utan normalisering. I din undersökning misstänker du också att hastighetsproblemen beror på att inferensberäkningarna använder 32-bitars flyttal.
Du vill justera kvantiseringskonfigurationen för att förbättra modellens inferenshastighet. Följande importer har redan laddats: AutoModelForCausalLM, AutoTokenizer och BitsAndBytesConfig.
Den här övningen är en del av kursen
Finjustering med Llama 3
Övningsinstruktioner
- Ange kvantiseringstypen till normaliserad 4-bitar för att minska extremvärden och på så sätt få mer korrekta svar.
- Ange beräkningstypen till bfloat16 för att snabba upp inferensberäkningarna.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
bnb_config = BitsAndBytesConfig(
load_in_4bit=True,
# Set quantization type to normalized 4-bit
____=____,
# Set compute data type to be bfloat16
____=____
)
model = AutoModelForCausalLM.from_pretrained(
"Maykeye/TinyLLama-v0",
quantization_config=bnb_config,
low_cpu_mem_usage=True
)