НачатьНачать бесплатно

Обнаружение дрейфа данных с помощью теста Колмогорова–Смирнова

После успешного развёртывания модели предсказания сердечных заболеваний вы отслеживаете её производительность и входные данные. Вы заметили, что распределение некоторых ключевых признаков в данных, собранных в феврале, несколько отличается от данных, на которых модель обучалась в январе. Подобные расхождения могут влиять на качество работы модели, поэтому их важно своевременно выявлять и устранять.

В этом упражнении вы воспользуетесь тестом Колмогорова–Смирнова (K-S) для обнаружения возможного дрейфа данных между январским и февральским наборами данных. Примеры наборов данных january_data и february_data уже загружены.

Это упражнение является частью курса

Сквозное машинное обучение

Посмотреть курс

Инструкции к упражнению

  • Импортируйте функцию ks_2samp из модуля scipy.stats.
  • Используйте предоставленные наборы данных january_data и february_data для выполнения теста Колмогорова–Смирнова: вычислите тестовую статистику и p-значение.
  • Проверьте, меньше ли p-значение, чем 0.05, что указывает на дрейф данных. Если дрейф обнаружен, выведите "Data drift detected.", в противном случае выведите "No data drift detected."

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the ks_2samp function
from ____.____ import ____

# Calculate the test statistic and p value
test_statistic, p_value = ____(____, ____)

# Check the p-value and print the detection result
if ____:
	print("Data drift detected.")
else:
	print("No data drift detected.")
Редактировать и запускать код