CommencezCommencez gratuitement

Dérive dans l'ensemble de données des réservations d'hôtel

Au chapitre précédent, vous avez calculé la valeur d'affaires et la performance ROC AUC pour un modèle qui prédit les annulations de réservation. Vous avez remarqué quelques alertes dans les graphiques obtenus, d'où la nécessité d'examiner la présence de dérive dans les données d'analyse.

Dans cet exercice, vous allez initialiser la méthode de détection de dérive multivariée et comparer ses résultats avec ceux de performance calculés au chapitre précédent.

StandardDeviationThreshold est déjà importé, tout comme la valeur d'affaires, et les résultats ROC AUC stockés dans la variable perf_results. La variable feature_column_names est également déjà définie.

Cette activité fait partie du cours

Surveiller le Machine Learning en Python

Voir le cours

Instructions de l’exercice

  • Initialisez la méthode StandardDeviationThreshold et réglez std_lower_multiplier à 2 et le paramètre std_upper_multiplier à 1.
  • Ajoutez les variables suivantes : country, lead_time, parking_spaces et hotel. Conservez leur ordre.
  • Transmettez les seuils et les noms de variables définis précédemment au DataReconstructionDriftCalculator.
  • Affichez le graphique de comparaison présentant à la fois les résultats de détection de dérive multivariée (mv_results) et les résultats de performance (perf_results).

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create standard deviation thresholds
stdt = StandardDeviationThreshold(____=____, ____=____)

# Define feature columns
feature_column_names = [____, ____, ____, ____]

# Intialize, fit, and show results of multivariate drift calculator
mv_calc = nannyml.DataReconstructionDriftCalculator(
    column_names=____,
	threshold = ____,
    timestamp_column_name='timestamp',
    chunk_period='m')
mv_calc.fit(reference)
mv_results = mv_calc.calculate(analysis)
mv_results.filter(period='analysis').____(____).plot().show()
Modifier et exécuter le code