Drift i hotellbokningsdatasetet
I det föregående kapitlet beräknade du affärsvärdet och ROC AUC-prestanda för en modell som förutspår bokningsavbokningar. Du noterade ett par varningar i de resulterande diagrammen, vilket är anledningen till att du nu behöver undersöka förekomsten av drift i analysdata.
I den här övningen initierar du den multivariata driftdetekteringsmetoden och jämför dess resultat med de prestandaresultat som beräknades i det föregående kapitlet.
StandardDeviationThreshold är redan importerat tillsammans med affärsvärdet, och ROC AUC-resultaten lagras i variabeln perf_results. feature_column_names är redan definierat.
Den här övningen är en del av kursen
Övervakning av maskininlärning i Python
Övningsinstruktioner
- Initiera metoden
StandardDeviationThresholdoch sätt parametrarnastd_lower_multipliertill2ochstd_upper_multipliertill1. - Lägg till följande särdragsnamn:
country,lead_time,parking_spacesochhotel. Behåll deras ordning. - Skicka de tidigare definierade tröskelvärdena och särdragsnamnen till
DataReconstructionDriftCalculator. - Visa jämförelsediagrammet med både de multivariata driftdetekteringsresultaten (
mv_results) och prestandaresultaten (perf_results).
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create standard deviation thresholds
stdt = StandardDeviationThreshold(____=____, ____=____)
# Define feature columns
feature_column_names = [____, ____, ____, ____]
# Intialize, fit, and show results of multivariate drift calculator
mv_calc = nannyml.DataReconstructionDriftCalculator(
column_names=____,
threshold = ____,
timestamp_column_name='timestamp',
chunk_period='m')
mv_calc.fit(reference)
mv_results = mv_calc.calculate(analysis)
mv_results.filter(period='analysis').____(____).plot().show()