НачатьНачать бесплатно

Загрузка моделей в 8-битном режиме

Ваша компания уже некоторое время использует модель Llama в чат-боте для службы поддержки клиентов. Вам поручили найти способ снизить потребление видеопамяти моделью без существенного ухудшения её качества. Это позволит команде перейти на более дешёвый вычислительный кластер и сэкономить значительные средства.

Вы решаете проверить, можно ли загрузить модель с 8-битным квантованием и при этом сохранить приемлемый уровень производительности.

Модель задана в переменной model_name. Классы AutoModelForCausalLM и AutoTokenizer уже импортированы.

Это упражнение является частью курса

Файн-тюнинг с Llama 3

Посмотреть курс

Инструкции к упражнению

  • Импортируйте класс конфигурации для загрузки моделей с квантованием.
  • Создайте экземпляр класса конфигурации квантования.
  • Задайте параметры квантования для загрузки модели в 8-битном режиме.
  • Передайте конфигурацию квантования в AutoModelForCausalLM, чтобы загрузить квантованную модель.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import quantization configuration class
from ____ import ____
# Instantiate quantization configuration
bnb_config = ____(
	# Set 8-bit loading
	____=True,
)
model = AutoModelForCausalLM.from_pretrained(
    "Maykeye/TinyLLama-v0",
  	# Set quantization parameters to load quantized model
    ____=bnb_config,
    low_cpu_mem_usage=True
)
Редактировать и запускать код