Виявлення дрейфу даних за допомогою критерію Колмогорова—Смирнова
Після успішного розгортання вашої моделі прогнозування серцевих захворювань ви відстежуєте її продуктивність і вхідні дані. Ви помітили, що розподіл деяких ключових ознак у нещодавно зібраних даних за лютий дещо відрізняється від даних, на яких ви навчалися в січні. Такі розбіжності можуть впливати на роботу моделі, тому їх важливо вчасно виявляти й усувати.
У цій вправі ви застосуєте критерій Колмогорова—Смирнова (K-S), щоб виявити можливий дрейф даних між січневим і лютневим наборами. Прикладові набори даних january_data і february_data уже завантажено для вас.
Ця вправа є частиною курсу
End-to-End Machine Learning
Інструкції до вправи
- Імпортуйте функцію
ks_2sampз модуляscipy.stats. - Використайте надані прикладові набори даних
january_dataіfebruary_data, щоб виконати критерій Колмогорова—Смирнова; обчисліть статистику тесту та p-значення. - Перевірте, чи
p-valueменше ніж 0.05, що вказує на дрейф даних; якщо дрейф виявлено, виведіть"Data drift detected.", інакше виведіть"No data drift detected."
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the ks_2samp function
from ____.____ import ____
# Calculate the test statistic and p value
test_statistic, p_value = ____(____, ____)
# Check the p-value and print the detection result
if ____:
print("Data drift detected.")
else:
print("No data drift detected.")