НачатьНачать бесплатно

Сравнение производительности квантизованной модели

Оценка улучшений производительности — это не только вопрос точности. Квантизованные модели зачастую работают быстрее при инференсе, что является важным преимуществом при развёртывании. В этом упражнении вы измерите, сколько времени требуется исходной и квантизованной моделям на обработку тестовой выборки.

Функция measure_time() уже определена заранее. Она переводит модель в режим оценки, выполняет прямой проход по всем батчам в загрузчике данных и возвращает затраченное время.

Обе модели — model (исходная) и model_quantized (квантизованная) — уже загружены вместе с test_loader.

Это упражнение является частью курса

Масштабируемые модели ИИ с PyTorch Lightning

Посмотреть курс

Инструкции к упражнению

  • Вычислите время инференса для исходной и квантизованной моделей.
  • Выведите оба значения, округлив их до двух знаков после запятой.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Measure inference time of the original model
original_time = measure_time(____)

# Measure inference time of the quantized model
quant_time = measure_time(____)

# Print results
print(f"Original Model Time: {____}s")
print(f"Quantized Model Time: {____}s")
Редактировать и запускать код