CommencezCommencez gratuitement

Agréguer des doublons partiels

Une autre façon de traiter les doublons partiels consiste à calculer une statistique sommaire des valeurs qui diffèrent entre les doublons partiels, comme la moyenne, la médiane, le maximum ou le minimum. Cela peut être utile lorsque vous n'êtes pas certain de la façon dont vos données ont été recueillies et que vous souhaitez une moyenne, ou si, selon vos connaissances du domaine, vous préférez surestimer plutôt que sous-estimer (ou l'inverse).

dplyr est chargé et bike_share_rides est disponible.

Cette activité fait partie du cours

Nettoyer des données avec R

Voir le cours

Instructions de l’exercice

  • Groupez bike_share_rides par ride_id et date.
  • Ajoutez une colonne nommée duration_min_avg qui contient la durée moyenne du trajet pour le ride_id et la date de la ligne.
  • Supprimez les doublons selon ride_id et date, en conservant toutes les colonnes du tableau de données.
  • Retirez la colonne duration_min.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

bike_share_rides %>%
  # Group by ride_id and date
  ___ %>%
  # Add duration_min_avg column
  mutate(duration_min_avg = ___ ) %>%
  # Remove duplicates based on ride_id and date, keep all cols
  ___ %>%
  # Remove duration_min column
  ___(-___)
Modifier et exécuter le code