Обнаружение дрейфа данных с помощью теста Колмогорова–Смирнова
После успешного развёртывания модели предсказания сердечных заболеваний вы отслеживаете её производительность и входные данные. Вы заметили, что распределение некоторых ключевых признаков в данных, собранных в феврале, несколько отличается от данных, на которых модель обучалась в январе. Подобные расхождения могут влиять на качество работы модели, поэтому их важно своевременно выявлять и устранять.
В этом упражнении вы воспользуетесь тестом Колмогорова–Смирнова (K-S) для обнаружения возможного дрейфа данных между январским и февральским наборами данных. Примеры наборов данных january_data и february_data уже загружены.
Это упражнение является частью курса
Сквозное машинное обучение
Инструкции к упражнению
- Импортируйте функцию
ks_2sampиз модуляscipy.stats. - Используйте предоставленные наборы данных
january_dataиfebruary_dataдля выполнения теста Колмогорова–Смирнова: вычислите тестовую статистику и p-значение. - Проверьте, меньше ли p-значение, чем 0.05, что указывает на дрейф данных. Если дрейф обнаружен, выведите
"Data drift detected.", в противном случае выведите"No data drift detected."
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the ks_2samp function
from ____.____ import ____
# Calculate the test statistic and p value
test_statistic, p_value = ____(____, ____)
# Check the p-value and print the detection result
if ____:
print("Data drift detected.")
else:
print("No data drift detected.")