Дріфт у наборі даних про бронювання готелів
У попередньому розділі ви обчислили бізнес-цінність і показник ROC AUC для моделі, що прогнозує скасування бронювань. На отриманих графіках ви помітили кілька сповіщень, тож потрібно перевірити наявність дріфту в даних для аналізу.
У цій вправі ви ініціалізуєте метод виявлення багатовимірного дріфту та порівняєте його результати з результатами продуктивности, обчисленими в попередньому розділі.
StandardDeviationThreshold уже імпортовано; також у змінній perf_results збережено бізнес-цінність і результати ROC AUC, а feature_column_names уже визначено.
Ця вправа є частиною курсу
Моніторинг Machine Learning у Python
Інструкції до вправи
- Ініціалізуйте метод
StandardDeviationThresholdі встановіть параметриstd_lower_multiplierу2таstd_upper_multiplierу1. - Додайте такі назви ознак:
country,lead_time,parking_spacesіhotel. Збережіть їхній порядок. - Передайте раніше визначені пороги та назви ознак до
DataReconstructionDriftCalculator. - Показуйте порівняльний графік, що містить результати багатовимірного виявлення дріфту (
mv_results) і результати продуктивности (perf_results).
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create standard deviation thresholds
stdt = StandardDeviationThreshold(____=____, ____=____)
# Define feature columns
feature_column_names = [____, ____, ____, ____]
# Intialize, fit, and show results of multivariate drift calculator
mv_calc = nannyml.DataReconstructionDriftCalculator(
column_names=____,
threshold = ____,
timestamp_column_name='timestamp',
chunk_period='m')
mv_calc.fit(reference)
mv_results = mv_calc.calculate(analysis)
mv_results.filter(period='analysis').____(____).plot().show()