Detekce data driftu pomocí Kolmogorov-Smirnovova testu
Po úspěšném nasazení modelu pro predikci srdečních onemocnění sleduješ jeho výkon a vstupní data. Všiml/a sis, že rozdělení některých klíčových příznaků v datech z února vypadá trochu jinak než v datech, na kterých jsi model trénoval/a v lednu. Takové rozdíly mohou ovlivnit výkon modelu, a proto je důležité je včas odhalit a řešit.
V tomto cvičení použiješ Kolmogorov-Smirnovův (K-S) test k detekci případného data driftu mezi lednovým a únorovým datasetem. Vzorové datasety january_data a february_data jsou již načteny.
Toto cvičení je součástí kurzu
Strojové učení od začátku do konce
Pokyny k cvičení
- Importuj funkci
ks_2sampz moduluscipy.stats. - Pomocí připravených vzorových datasetů
january_dataafebruary_dataproveď Kolmogorov-Smirnovův test a vypočítej testovou statistiku a p-hodnotu. - Zkontroluj, zda je p-hodnota menší než 0.05, což by signalizovalo data drift. Pokud je data drift detekován, vypiš
"Data drift detected.", v opačném případě vypiš"No data drift detected."
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the ks_2samp function
from ____.____ import ____
# Calculate the test statistic and p value
test_statistic, p_value = ____(____, ____)
# Check the p-value and print the detection result
if ____:
print("Data drift detected.")
else:
print("No data drift detected.")