CommencezCommencez gratuitement

Doublons complets

On vous a informé qu'une mise à jour a été apportée au pipeline de données du service de vélopartage pour le rendre plus efficace, mais que cela risque de générer davantage de doublons. Pour pouvoir continuer à utiliser les mêmes scripts pour exécuter vos analyses hebdomadaires des statistiques de trajets, vous devez d'abord vous assurer que tous les doublons du jeu de données sont supprimés.

Quand plusieurs lignes d'une trame de données partagent les mêmes valeurs pour toutes les colonnes, ce sont des doublons complets les unes des autres. Les supprimer est important, car la répétition d'une même valeur peut fausser des statistiques sommaires comme la moyenne et la médiane. Chaque trajet, y compris son ride_id, devrait être unique.

dplyr est déjà chargé et bike_share_rides est disponible.

Cette activité fait partie du cours

Nettoyer des données avec R

Voir le cours

Instructions de l’exercice

  • Obtenez le nombre total de doublons complets dans bike_share_rides.
  • Supprimez tous les doublons complets de bike_share_rides et enregistrez la nouvelle trame de données sous le nom bike_share_rides_unique.
  • Obtenez le nombre total de doublons complets dans la nouvelle trame de données bike_share_rides_unique.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Count the number of full duplicates
___

# Remove duplicates
bike_share_rides_unique <- ___

# Count the full duplicates in bike_share_rides_unique
___
Modifier et exécuter le code