Carregando modelos em 8 bits
Sua empresa usa um modelo Llama no chatbot de atendimento ao cliente há algum tempo. Você recebeu a tarefa de descobrir como reduzir o uso de memória de GPU do modelo sem afetar significativamente o desempenho. Isso permitirá que a equipe migre para um cluster de computação mais barato e economize bastante para a empresa.
Você decide testar se é possível carregar o modelo com quantização em 8 bits mantendo um desempenho razoável.
O modelo está em model_name. AutoModelForCausalLM e AutoTokenizer já foram importados para você.
Este exercicio faz parte do curso
Ajuste Fino com Llama 3
Instruções do exercicio
- Importe a classe de configuração para habilitar o carregamento de modelos com quantização.
- Instancie a classe de configuração de quantização.
- Configure os parâmetros de quantização para carregar o modelo em 8 bits.
- Passe a configuração de quantização para
AutoModelForCausalLMpara carregar o modelo quantizado.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Import quantization configuration class
from ____ import ____
# Instantiate quantization configuration
bnb_config = ____(
# Set 8-bit loading
____=True,
)
model = AutoModelForCausalLM.from_pretrained(
"Maykeye/TinyLLama-v0",
# Set quantization parameters to load quantized model
____=bnb_config,
low_cpu_mem_usage=True
)