Wykrywanie dryfu danych za pomocą testu Kołmogorowa-Smirnowa
Po pomyślnym wdrożeniu modelu do przewidywania chorób serca monitorujesz jego wydajność oraz dane wejściowe. Zauważasz, że rozkład niektórych kluczowych cech w danych zebranych w lutym różni się nieco od danych, na których trenowano model w styczniu. Tego rodzaju rozbieżności mogą wpływać na jakość modelu, dlatego ważne jest ich wykrycie i odpowiednia reakcja.
W tym ćwiczeniu użyjesz testu Kołmogorowa-Smirnowa (K-S), aby wykryć ewentualny dryfowanie danych między zbiorami ze stycznia i lutego. Przykładowe zbiory danych january_data i february_data są już wczytane.
To ćwiczenie jest częścią kursu
End-to-End Machine Learning
Instrukcje do ćwiczenia
- Zaimportuj funkcję
ks_2sampz modułuscipy.stats. - Użyj dostarczonych zbiorów danych
january_dataifebruary_data, aby przeprowadzić test Kołmogorowa-Smirnowa; oblicz statystykę testową i p-value. - Sprawdź, czy p-value jest mniejsze od 0.05, co wskazuje na dryfowanie danych; jeśli dryfowanie zostanie wykryte, wypisz
"Data drift detected.", w przeciwnym razie wypisz"No data drift detected."
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the ks_2samp function
from ____.____ import ____
# Calculate the test statistic and p value
test_statistic, p_value = ____(____, ____)
# Check the p-value and print the detection result
if ____:
print("Data drift detected.")
else:
print("No data drift detected.")