Doublons complets
On vous a informé qu'une mise à jour a été apportée au pipeline de données du service de vélopartage pour le rendre plus efficace, mais que cela risque de générer davantage de doublons. Pour pouvoir continuer à utiliser les mêmes scripts pour exécuter vos analyses hebdomadaires des statistiques de trajets, vous devez d'abord vous assurer que tous les doublons du jeu de données sont supprimés.
Quand plusieurs lignes d'une trame de données partagent les mêmes valeurs pour toutes les colonnes, ce sont des doublons complets les unes des autres. Les supprimer est important, car la répétition d'une même valeur peut fausser des statistiques sommaires comme la moyenne et la médiane. Chaque trajet, y compris son ride_id, devrait être unique.
dplyr est déjà chargé et bike_share_rides est disponible.
Cette activité fait partie du cours
Nettoyer des données avec R
Instructions de l’exercice
- Obtenez le nombre total de doublons complets dans
bike_share_rides. - Supprimez tous les doublons complets de
bike_share_rideset enregistrez la nouvelle trame de données sous le nombike_share_rides_unique. - Obtenez le nombre total de doublons complets dans la nouvelle trame de données
bike_share_rides_unique.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Count the number of full duplicates
___
# Remove duplicates
bike_share_rides_unique <- ___
# Count the full duplicates in bike_share_rides_unique
___