НачатьНачать бесплатно

Дрейф в наборе данных о бронировании отелей

В предыдущей главе вы рассчитали бизнес-ценность и метрику ROC AUC для модели, предсказывающей отмену бронирования. На полученных графиках вы заметили несколько предупреждений, поэтому необходимо проверить наличие дрейфа в анализируемых данных.

В этом упражнении вы инициализируете метод многомерного обнаружения дрейфа и сравните его результаты с результатами оценки производительности, рассчитанными в предыдущей главе.

StandardDeviationThreshold уже импортирован, бизнес-ценность и результаты ROC AUC хранятся в переменной perf_results, а feature_column_names уже определены.

Это упражнение является частью курса

Мониторинг машинного обучения на Python

Посмотреть курс

Инструкции к упражнению

  • Инициализируйте метод StandardDeviationThreshold и задайте параметру std_lower_multiplier значение 2, а параметру std_upper_multiplier — значение 1.
  • Добавьте следующие названия признаков: country, lead_time, parking_spaces и hotel, сохранив их порядок.
  • Передайте ранее определённые пороговые значения и названия признаков в DataReconstructionDriftCalculator.
  • Отобразите сравнительный график, включающий результаты многомерного обнаружения дрейфа (mv_results) и результаты оценки производительности (perf_results).

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create standard deviation thresholds
stdt = StandardDeviationThreshold(____=____, ____=____)

# Define feature columns
feature_column_names = [____, ____, ____, ____]

# Intialize, fit, and show results of multivariate drift calculator
mv_calc = nannyml.DataReconstructionDriftCalculator(
    column_names=____,
	threshold = ____,
    timestamp_column_name='timestamp',
    chunk_period='m')
mv_calc.fit(reference)
mv_results = mv_calc.calculate(analysis)
mv_results.filter(period='analysis').____(____).plot().show()
Редактировать и запускать код