ПочатиПочніть безкоштовно

Дріфт у наборі даних про бронювання готелів

У попередньому розділі ви обчислили бізнес-цінність і показник ROC AUC для моделі, що прогнозує скасування бронювань. На отриманих графіках ви помітили кілька сповіщень, тож потрібно перевірити наявність дріфту в даних для аналізу.

У цій вправі ви ініціалізуєте метод виявлення багатовимірного дріфту та порівняєте його результати з результатами продуктивности, обчисленими в попередньому розділі.

StandardDeviationThreshold уже імпортовано; також у змінній perf_results збережено бізнес-цінність і результати ROC AUC, а feature_column_names уже визначено.

Ця вправа є частиною курсу

Моніторинг Machine Learning у Python

Переглянути курс

Інструкції до вправи

  • Ініціалізуйте метод StandardDeviationThreshold і встановіть параметри std_lower_multiplier у 2 та std_upper_multiplier у 1.
  • Додайте такі назви ознак: country, lead_time, parking_spaces і hotel. Збережіть їхній порядок.
  • Передайте раніше визначені пороги та назви ознак до DataReconstructionDriftCalculator.
  • Показуйте порівняльний графік, що містить результати багатовимірного виявлення дріфту (mv_results) і результати продуктивности (perf_results).

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create standard deviation thresholds
stdt = StandardDeviationThreshold(____=____, ____=____)

# Define feature columns
feature_column_names = [____, ____, ____, ____]

# Intialize, fit, and show results of multivariate drift calculator
mv_calc = nannyml.DataReconstructionDriftCalculator(
    column_names=____,
	threshold = ____,
    timestamp_column_name='timestamp',
    chunk_period='m')
mv_calc.fit(reference)
mv_results = mv_calc.calculate(analysis)
mv_results.filter(period='analysis').____(____).plot().show()
Редагувати та запускати код