Загрузка моделей в 8-битном режиме
Ваша компания уже некоторое время использует модель Llama в чат-боте для службы поддержки клиентов. Вам поручили найти способ снизить потребление видеопамяти моделью без существенного ухудшения её качества. Это позволит команде перейти на более дешёвый вычислительный кластер и сэкономить значительные средства.
Вы решаете проверить, можно ли загрузить модель с 8-битным квантованием и при этом сохранить приемлемый уровень производительности.
Модель задана в переменной model_name. Классы AutoModelForCausalLM и AutoTokenizer уже импортированы.
Это упражнение является частью курса
Файн-тюнинг с Llama 3
Инструкции к упражнению
- Импортируйте класс конфигурации для загрузки моделей с квантованием.
- Создайте экземпляр класса конфигурации квантования.
- Задайте параметры квантования для загрузки модели в 8-битном режиме.
- Передайте конфигурацию квантования в
AutoModelForCausalLM, чтобы загрузить квантованную модель.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import quantization configuration class
from ____ import ____
# Instantiate quantization configuration
bnb_config = ____(
# Set 8-bit loading
____=True,
)
model = AutoModelForCausalLM.from_pretrained(
"Maykeye/TinyLLama-v0",
# Set quantization parameters to load quantized model
____=bnb_config,
low_cpu_mem_usage=True
)