Acelerando a inferência em modelos quantizados
Sua empresa vem usando um modelo Llama com quantização no chatbot de atendimento ao cliente há algum tempo. Uma das maiores reclamações dos clientes é que o bot responde muito devagar e às vezes gera respostas estranhas.
Você suspeita que isso pode estar relacionado à quantização para 4 bits sem normalização. Na sua investigação, você também suspeita que a troca de desempenho em velocidade vem dos cálculos de inferência, que estão usando floats de 32 bits.
Você quer ajustar as configurações de quantização para melhorar a velocidade de inferência do seu modelo. As seguintes importações já foram carregadas: AutoModelForCausalLM, AutoTokenizer e BitsAndBytesConfig.
Este exercicio faz parte do curso
Ajuste Fino com Llama 3
Instruções do exercicio
- Defina o tipo de quantização como 4 bits normalizado para reduzir outliers e, assim, produzir menos respostas sem sentido.
- Defina o tipo de computação como bfloat16 para acelerar a velocidade dos cálculos de inferência.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
bnb_config = BitsAndBytesConfig(
load_in_4bit=True,
# Set quantization type to normalized 4-bit
____=____,
# Set compute data type to be bfloat16
____=____
)
model = AutoModelForCausalLM.from_pretrained(
"Maykeye/TinyLLama-v0",
quantization_config=bnb_config,
low_cpu_mem_usage=True
)