Сравнение производительности квантизованной модели
Оценка улучшений производительности — это не только вопрос точности. Квантизованные модели зачастую работают быстрее при инференсе, что является важным преимуществом при развёртывании. В этом упражнении вы измерите, сколько времени требуется исходной и квантизованной моделям на обработку тестовой выборки.
Функция measure_time() уже определена заранее. Она переводит модель в режим оценки, выполняет прямой проход по всем батчам в загрузчике данных и возвращает затраченное время.
Обе модели — model (исходная) и model_quantized (квантизованная) — уже загружены вместе с test_loader.
Это упражнение является частью курса
Масштабируемые модели ИИ с PyTorch Lightning
Инструкции к упражнению
- Вычислите время инференса для исходной и квантизованной моделей.
- Выведите оба значения, округлив их до двух знаков после запятой.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Measure inference time of the original model
original_time = measure_time(____)
# Measure inference time of the quantized model
quant_time = measure_time(____)
# Print results
print(f"Original Model Time: {____}s")
print(f"Quantized Model Time: {____}s")