ПочатиПочніть безкоштовно

Виявлення дрейфу даних за допомогою критерію Колмогорова—Смирнова

Після успішного розгортання вашої моделі прогнозування серцевих захворювань ви відстежуєте її продуктивність і вхідні дані. Ви помітили, що розподіл деяких ключових ознак у нещодавно зібраних даних за лютий дещо відрізняється від даних, на яких ви навчалися в січні. Такі розбіжності можуть впливати на роботу моделі, тому їх важливо вчасно виявляти й усувати.

У цій вправі ви застосуєте критерій Колмогорова—Смирнова (K-S), щоб виявити можливий дрейф даних між січневим і лютневим наборами. Прикладові набори даних january_data і february_data уже завантажено для вас.

Ця вправа є частиною курсу

End-to-End Machine Learning

Переглянути курс

Інструкції до вправи

  • Імпортуйте функцію ks_2samp з модуля scipy.stats.
  • Використайте надані прикладові набори даних january_data і february_data, щоб виконати критерій Колмогорова—Смирнова; обчисліть статистику тесту та p-значення.
  • Перевірте, чи p-value менше ніж 0.05, що вказує на дрейф даних; якщо дрейф виявлено, виведіть "Data drift detected.", інакше виведіть "No data drift detected."

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the ks_2samp function
from ____.____ import ____

# Calculate the test statistic and p value
test_statistic, p_value = ____(____, ____)

# Check the p-value and print the detection result
if ____:
	print("Data drift detected.")
else:
	print("No data drift detected.")
Редагувати та запускати код