Zacznij terazZacznij za darmo

Porównanie wydajności modelu po kwantyzacji

Ocena ulepszeń wydajności to nie tylko kwestia dokładności. Modele po kwantyzacji często działają szybciej podczas wnioskowania – to kluczowa zaleta w scenariuszach wdrożeniowych. Zmierzysz, ile czasu zajmuje obu modelom – oryginalnemu i skwantyzowanemu – przetworzenie zbioru testowego.

Funkcja measure_time() jest już zdefiniowana. Przełącza model w tryb ewaluacji, wykonuje przejście w przód na wszystkich partiach w dataloaderie i zwraca czas wykonania.

Zarówno model (oryginalny model), jak i model_quantized (wersja po kwantyzacji) są wstępnie załadowane wraz z test_loader.

To ćwiczenie jest częścią kursu

Skalowalne modele AI z PyTorch Lightning

Zobacz kurs

Instrukcje do ćwiczenia

  • Oblicz czas wnioskowania dla oryginalnego modelu i modelu po kwantyzacji.
  • Wyświetl oba czasy zaokrąglone do dwóch miejsc po przecinku.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Measure inference time of the original model
original_time = measure_time(____)

# Measure inference time of the quantized model
quant_time = measure_time(____)

# Print results
print(f"Original Model Time: {____}s")
print(f"Quantized Model Time: {____}s")
Edytuj i uruchom kod