Дрейф в наборе данных о бронировании отелей
В предыдущей главе вы рассчитали бизнес-ценность и метрику ROC AUC для модели, предсказывающей отмену бронирования. На полученных графиках вы заметили несколько предупреждений, поэтому необходимо проверить наличие дрейфа в анализируемых данных.
В этом упражнении вы инициализируете метод многомерного обнаружения дрейфа и сравните его результаты с результатами оценки производительности, рассчитанными в предыдущей главе.
StandardDeviationThreshold уже импортирован, бизнес-ценность и результаты ROC AUC хранятся в переменной perf_results, а feature_column_names уже определены.
Это упражнение является частью курса
Мониторинг машинного обучения на Python
Инструкции к упражнению
- Инициализируйте метод
StandardDeviationThresholdи задайте параметруstd_lower_multiplierзначение2, а параметруstd_upper_multiplier— значение1. - Добавьте следующие названия признаков:
country,lead_time,parking_spacesиhotel, сохранив их порядок. - Передайте ранее определённые пороговые значения и названия признаков в
DataReconstructionDriftCalculator. - Отобразите сравнительный график, включающий результаты многомерного обнаружения дрейфа (
mv_results) и результаты оценки производительности (perf_results).
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create standard deviation thresholds
stdt = StandardDeviationThreshold(____=____, ____=____)
# Define feature columns
feature_column_names = [____, ____, ____, ____]
# Intialize, fit, and show results of multivariate drift calculator
mv_calc = nannyml.DataReconstructionDriftCalculator(
column_names=____,
threshold = ____,
timestamp_column_name='timestamp',
chunk_period='m')
mv_calc.fit(reference)
mv_results = mv_calc.calculate(analysis)
mv_results.filter(period='analysis').____(____).plot().show()