Ускорение инференса в квантизованных моделях
Ваша компания уже некоторое время использует модель Llama для чат-бота клиентской поддержки с применением квантизации. Одна из главных жалоб клиентов — бот отвечает очень медленно и иногда выдаёт странные ответы.
Вы предполагаете, что причина может быть в квантизации до 4 бит без нормализации. В ходе анализа вы также замечаете, что снижение скорости связано с вычислениями при инференсе, которые используют 32-битные числа с плавающей точкой.
Вы хотите скорректировать конфигурацию квантизации, чтобы повысить скорость инференса модели. Следующие импорты уже загружены: AutoModelForCausalLM, AutoTokenizer и BitsAndBytesConfig.
Это упражнение является частью курса
Файн-тюнинг с Llama 3
Инструкции к упражнению
- Задайте тип квантизации — нормализованный 4-битный, чтобы уменьшить выбросы и сократить количество некорректных ответов.
- Задайте тип вычислений bfloat16, чтобы ускорить инференс.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
bnb_config = BitsAndBytesConfig(
load_in_4bit=True,
# Set quantization type to normalized 4-bit
____=____,
# Set compute data type to be bfloat16
____=____
)
model = AutoModelForCausalLM.from_pretrained(
"Maykeye/TinyLLama-v0",
quantization_config=bnb_config,
low_cpu_mem_usage=True
)