Driftul în setul de date pentru rezervări hoteliere
În capitolul anterior, ai calculat valoarea de business și performanța ROC AUC pentru un model care prezice anulările de rezervări. Ai observat câteva alerte în graficele rezultate, motiv pentru care trebuie să investighezi prezența driftului în datele de analiză.
În acest exercițiu, vei inițializa metoda de detectare a driftului multivariat și vei compara rezultatele sale cu rezultatele de performanță calculate în capitolul anterior.
StandardDeviationThreshold este deja importat, împreună cu rezultatele pentru valoarea de business și ROC AUC stocate în variabila perf_results, iar feature_column_names este deja definit.
Acest exercițiu face parte din cursul
Monitorizarea Machine Learning în Python
Instrucțiuni pentru exercițiu
- Inițializează metoda
StandardDeviationThresholdși setează parametriistd_lower_multiplierla2șistd_upper_multiplierla1. - Adaugă următoarele nume de caracteristici:
country,lead_time,parking_spacesșihotel. Păstrează ordinea lor. - Transmite pragurile și numele caracteristicilor definite anterior către
DataReconstructionDriftCalculator. - Afișează graficul comparativ care include atât rezultatele detectării driftului multivariat (
mv_results), cât și rezultatele de performanță (perf_results).
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create standard deviation thresholds
stdt = StandardDeviationThreshold(____=____, ____=____)
# Define feature columns
feature_column_names = [____, ____, ____, ____]
# Intialize, fit, and show results of multivariate drift calculator
mv_calc = nannyml.DataReconstructionDriftCalculator(
column_names=____,
threshold = ____,
timestamp_column_name='timestamp',
chunk_period='m')
mv_calc.fit(reference)
mv_results = mv_calc.calculate(analysis)
mv_results.filter(period='analysis').____(____).plot().show()