НачатьНачать бесплатно

Ускорение инференса в квантизованных моделях

Ваша компания уже некоторое время использует модель Llama для чат-бота клиентской поддержки с применением квантизации. Одна из главных жалоб клиентов — бот отвечает очень медленно и иногда выдаёт странные ответы.

Вы предполагаете, что причина может быть в квантизации до 4 бит без нормализации. В ходе анализа вы также замечаете, что снижение скорости связано с вычислениями при инференсе, которые используют 32-битные числа с плавающей точкой.

Вы хотите скорректировать конфигурацию квантизации, чтобы повысить скорость инференса модели. Следующие импорты уже загружены: AutoModelForCausalLM, AutoTokenizer и BitsAndBytesConfig.

Это упражнение является частью курса

Файн-тюнинг с Llama 3

Посмотреть курс

Инструкции к упражнению

  • Задайте тип квантизации — нормализованный 4-битный, чтобы уменьшить выбросы и сократить количество некорректных ответов.
  • Задайте тип вычислений bfloat16, чтобы ускорить инференс.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

bnb_config = BitsAndBytesConfig(
    load_in_4bit=True,
  	# Set quantization type to normalized 4-bit
    ____=____,
  	# Set compute data type to be bfloat16
    ____=____
)
model = AutoModelForCausalLM.from_pretrained(
    "Maykeye/TinyLLama-v0",
    quantization_config=bnb_config,
    low_cpu_mem_usage=True
)
Редактировать и запускать код