Porównanie wydajności modelu po kwantyzacji
Ocena ulepszeń wydajności to nie tylko kwestia dokładności. Modele po kwantyzacji często działają szybciej podczas wnioskowania – to kluczowa zaleta w scenariuszach wdrożeniowych. Zmierzysz, ile czasu zajmuje obu modelom – oryginalnemu i skwantyzowanemu – przetworzenie zbioru testowego.
Funkcja measure_time() jest już zdefiniowana. Przełącza model w tryb ewaluacji, wykonuje przejście w przód na wszystkich partiach w dataloaderie i zwraca czas wykonania.
Zarówno model (oryginalny model), jak i model_quantized (wersja po kwantyzacji) są wstępnie załadowane wraz z test_loader.
To ćwiczenie jest częścią kursu
Skalowalne modele AI z PyTorch Lightning
Instrukcje do ćwiczenia
- Oblicz czas wnioskowania dla oryginalnego modelu i modelu po kwantyzacji.
- Wyświetl oba czasy zaokrąglone do dwóch miejsc po przecinku.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Measure inference time of the original model
original_time = measure_time(____)
# Measure inference time of the quantized model
quant_time = measure_time(____)
# Print results
print(f"Original Model Time: {____}s")
print(f"Quantized Model Time: {____}s")