ПочатиПочніть безкоштовно

Прискорення інференсу в квантизованих моделях

Ваша компанія вже певний час використовує модель Llama для чат-бота підтримки клієнтів із квантизацією. Одна з найбільших скарг користувачів — бот відповідає дуже повільно і часом видає дивні відповіді.

Ви підозрюєте, що причина може бути у квантизації до 4 біт без нормалізації. Під час дослідження ви також припустили, що компроміс у швидкості виникає під час обчислень інференсу, де використовуються 32-бітні числа з рухомою комою.

Ви хочете відкоригувати параметри квантизації, щоб підвищити швидкість інференсу вашої моделі. Наступні імпорти вже завантажено: AutoModelForCausalLM, AutoTokenizer і BitsAndBytesConfig.

Ця вправа є частиною курсу

Тонке налаштування з Llama 3

Переглянути курс

Інструкції до вправи

  • Установіть тип квантизації як нормалізований 4-бітний, щоб зменшити викиди й уникнути беззмістовних відповідей.
  • Установіть тип обчислень на bfloat16, щоб пришвидшити обчислення під час інференсу.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

bnb_config = BitsAndBytesConfig(
    load_in_4bit=True,
  	# Set quantization type to normalized 4-bit
    ____=____,
  	# Set compute data type to be bfloat16
    ____=____
)
model = AutoModelForCausalLM.from_pretrained(
    "Maykeye/TinyLLama-v0",
    quantization_config=bnb_config,
    low_cpu_mem_usage=True
)
Редагувати та запускати код