Kom igångKom igång gratis

Drift i hotellbokningsdatasetet

I det föregående kapitlet beräknade du affärsvärdet och ROC AUC-prestanda för en modell som förutspår bokningsavbokningar. Du noterade ett par varningar i de resulterande diagrammen, vilket är anledningen till att du nu behöver undersöka förekomsten av drift i analysdata.

I den här övningen initierar du den multivariata driftdetekteringsmetoden och jämför dess resultat med de prestandaresultat som beräknades i det föregående kapitlet.

StandardDeviationThreshold är redan importerat tillsammans med affärsvärdet, och ROC AUC-resultaten lagras i variabeln perf_results. feature_column_names är redan definierat.

Den här övningen är en del av kursen

Övervakning av maskininlärning i Python

Visa kurs

Övningsinstruktioner

  • Initiera metoden StandardDeviationThreshold och sätt parametrarna std_lower_multiplier till 2 och std_upper_multiplier till 1.
  • Lägg till följande särdragsnamn: country, lead_time, parking_spaces och hotel. Behåll deras ordning.
  • Skicka de tidigare definierade tröskelvärdena och särdragsnamnen till DataReconstructionDriftCalculator.
  • Visa jämförelsediagrammet med både de multivariata driftdetekteringsresultaten (mv_results) och prestandaresultaten (perf_results).

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create standard deviation thresholds
stdt = StandardDeviationThreshold(____=____, ____=____)

# Define feature columns
feature_column_names = [____, ____, ____, ____]

# Intialize, fit, and show results of multivariate drift calculator
mv_calc = nannyml.DataReconstructionDriftCalculator(
    column_names=____,
	threshold = ____,
    timestamp_column_name='timestamp',
    chunk_period='m')
mv_calc.fit(reference)
mv_results = mv_calc.calculate(analysis)
mv_results.filter(period='analysis').____(____).plot().show()
Redigera och kör kod