Comece agoraComece grátis

Acelerando a inferência em modelos quantizados

Sua empresa vem usando um modelo Llama com quantização no chatbot de atendimento ao cliente há algum tempo. Uma das maiores reclamações dos clientes é que o bot responde muito devagar e às vezes gera respostas estranhas.

Você suspeita que isso pode estar relacionado à quantização para 4 bits sem normalização. Na sua investigação, você também suspeita que a troca de desempenho em velocidade vem dos cálculos de inferência, que estão usando floats de 32 bits.

Você quer ajustar as configurações de quantização para melhorar a velocidade de inferência do seu modelo. As seguintes importações já foram carregadas: AutoModelForCausalLM, AutoTokenizer e BitsAndBytesConfig.

Este exercicio faz parte do curso

Ajuste Fino com Llama 3

Ver curso

Instruções do exercicio

  • Defina o tipo de quantização como 4 bits normalizado para reduzir outliers e, assim, produzir menos respostas sem sentido.
  • Defina o tipo de computação como bfloat16 para acelerar a velocidade dos cálculos de inferência.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

bnb_config = BitsAndBytesConfig(
    load_in_4bit=True,
  	# Set quantization type to normalized 4-bit
    ____=____,
  	# Set compute data type to be bfloat16
    ____=____
)
model = AutoModelForCausalLM.from_pretrained(
    "Maykeye/TinyLLama-v0",
    quantization_config=bnb_config,
    low_cpu_mem_usage=True
)
Editar e Executar Código