Vérifications de la qualité des données
Comme vous l'avez vu dans la vidéo précédente, les valeurs manquantes peuvent entraîner une perte d'information précieuse et mener à de mauvaises interprétations. De même, la présence de valeurs inédites peut aussi nuire à la confiance de votre modèle.
Dans cet exercice, votre objectif est de vérifier si l'ensemble de données sur les réservations d'hôtel contient des valeurs manquantes et d'identifier toute valeur inédite. Les ensembles de référence et d'analyse sont déjà chargés, tout comme la bibliothèque nannyml.
Petit rappel : si vous ne vous souvenez plus du type des colonnes, vous pouvez explorer les données facilement avec la méthode .head().
Cette activité fait partie du cours
Surveiller le Machine Learning en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Define analyzed columns
selected_columns = ['country', 'lead_time', 'parking_spaces', 'hotel']
# Intialize missing values calculator
ms_calc = ____.____(
____=____,
____=____,
timestamp_column_name='timestamp'
)
# Fit, calculate and plot the results
ms_calc.fit(reference)
ms_results = ms_calc.calculate(analysis)
ms_results.plot().show()