Dérive dans l'ensemble de données des réservations d'hôtel
Au chapitre précédent, vous avez calculé la valeur d'affaires et la performance ROC AUC pour un modèle qui prédit les annulations de réservation. Vous avez remarqué quelques alertes dans les graphiques obtenus, d'où la nécessité d'examiner la présence de dérive dans les données d'analyse.
Dans cet exercice, vous allez initialiser la méthode de détection de dérive multivariée et comparer ses résultats avec ceux de performance calculés au chapitre précédent.
StandardDeviationThreshold est déjà importé, tout comme la valeur d'affaires, et les résultats ROC AUC stockés dans la variable perf_results. La variable feature_column_names est également déjà définie.
Cette activité fait partie du cours
Surveiller le Machine Learning en Python
Instructions de l’exercice
- Initialisez la méthode
StandardDeviationThresholdet réglezstd_lower_multiplierà2et le paramètrestd_upper_multiplierà1. - Ajoutez les variables suivantes :
country,lead_time,parking_spacesethotel. Conservez leur ordre. - Transmettez les seuils et les noms de variables définis précédemment au
DataReconstructionDriftCalculator. - Affichez le graphique de comparaison présentant à la fois les résultats de détection de dérive multivariée (
mv_results) et les résultats de performance (perf_results).
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create standard deviation thresholds
stdt = StandardDeviationThreshold(____=____, ____=____)
# Define feature columns
feature_column_names = [____, ____, ____, ____]
# Intialize, fit, and show results of multivariate drift calculator
mv_calc = nannyml.DataReconstructionDriftCalculator(
column_names=____,
threshold = ____,
timestamp_column_name='timestamp',
chunk_period='m')
mv_calc.fit(reference)
mv_results = mv_calc.calculate(analysis)
mv_results.filter(period='analysis').____(____).plot().show()