Drift v datasetu hotelových rezervací
V předchozí kapitole jsi pro model predikující zrušení rezervací vypočítal/a obchodní hodnotu a výkonnostní metriku ROC AUC. V výsledných grafech ses všiml/a několika upozornění – proto je teď potřeba prověřit, zda se v analytických datech vyskytuje drift.
V tomto cvičení inicializuješ metodu pro detekci multivariátního driftu a porovnáš její výsledky s výsledky výkonnosti z předchozí kapitoly.
StandardDeviationThreshold je již importován, obchodní hodnota a výsledky ROC AUC jsou uloženy v proměnné perf_results a feature_column_names je již definováno.
Toto cvičení je součástí kurzu
Monitoring Machine Learning in Python
Pokyny k cvičení
- Inicializuj metodu
StandardDeviationThresholda nastav parametrystd_lower_multiplierna2astd_upper_multiplierna1. - Přidej následující názvy příznaků:
country,lead_time,parking_spacesahotel. Zachovej jejich pořadí. - Předej dříve definované prahové hodnoty a názvy příznaků do
DataReconstructionDriftCalculator. - Zobraz porovnávací graf obsahující výsledky multivariátní detekce driftu (
mv_results) i výsledky výkonnosti (perf_results).
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create standard deviation thresholds
stdt = StandardDeviationThreshold(____=____, ____=____)
# Define feature columns
feature_column_names = [____, ____, ____, ____]
# Intialize, fit, and show results of multivariate drift calculator
mv_calc = nannyml.DataReconstructionDriftCalculator(
column_names=____,
threshold = ____,
timestamp_column_name='timestamp',
chunk_period='m')
mv_calc.fit(reference)
mv_results = mv_calc.calculate(analysis)
mv_results.filter(period='analysis').____(____).plot().show()