Comece agoraComece grátis

Carregando modelos em 8 bits

Sua empresa usa um modelo Llama no chatbot de atendimento ao cliente há algum tempo. Você recebeu a tarefa de descobrir como reduzir o uso de memória de GPU do modelo sem afetar significativamente o desempenho. Isso permitirá que a equipe migre para um cluster de computação mais barato e economize bastante para a empresa.

Você decide testar se é possível carregar o modelo com quantização em 8 bits mantendo um desempenho razoável.

O modelo está em model_name. AutoModelForCausalLM e AutoTokenizer já foram importados para você.

Este exercicio faz parte do curso

Ajuste Fino com Llama 3

Ver curso

Instruções do exercicio

  • Importe a classe de configuração para habilitar o carregamento de modelos com quantização.
  • Instancie a classe de configuração de quantização.
  • Configure os parâmetros de quantização para carregar o modelo em 8 bits.
  • Passe a configuração de quantização para AutoModelForCausalLM para carregar o modelo quantizado.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Import quantization configuration class
from ____ import ____
# Instantiate quantization configuration
bnb_config = ____(
	# Set 8-bit loading
	____=True,
)
model = AutoModelForCausalLM.from_pretrained(
    "Maykeye/TinyLLama-v0",
  	# Set quantization parameters to load quantized model
    ____=bnb_config,
    low_cpu_mem_usage=True
)
Editar e Executar Código