Repérer les doublons
Une nouvelle mise à jour du pipeline de données alimentant ride_sharing a ajouté la colonne ride_id, qui représente un identifiant unique pour chaque trajet.
Cependant, cette mise à jour a coïncidé avec une baisse radicale de la durée moyenne des trajets et des années de naissance d’utilisateurs fixées dans le futur. Plus important encore, le nombre de trajets effectués a augmenté de 20 % du jour au lendemain, ce qui vous porte à croire qu’il pourrait y avoir des doublons complets et incomplets dans le DataFrame ride_sharing.
Dans cet exercice, vous allez confirmer ce soupçon en trouvant ces doublons. Un échantillon de ride_sharing est disponible dans votre environnement, ainsi que tous les modules avec lesquels vous avez travaillé jusqu’ici.
Cette activité fait partie du cours
Nettoyage des données en Python
Instructions de l’exercice
- Repérez les lignes en double de
ride_iddans le DataFrameride_sharingen définissantkeepàFalse. - Filtrez
ride_sharingavecduplicates, triez parride_idet assignez le résultat àduplicated_rides. - Affichez, dans cet ordre, les colonnes
ride_id,durationetuser_birth_yeardeduplicated_rides.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Find duplicates
duplicates = ____.____(____, ____)
# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')
# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])