Agréguer des doublons partiels
Une autre façon de traiter les doublons partiels consiste à calculer une statistique sommaire des valeurs qui diffèrent entre les doublons partiels, comme la moyenne, la médiane, le maximum ou le minimum. Cela peut être utile lorsque vous n'êtes pas certain de la façon dont vos données ont été recueillies et que vous souhaitez une moyenne, ou si, selon vos connaissances du domaine, vous préférez surestimer plutôt que sous-estimer (ou l'inverse).
dplyr est chargé et bike_share_rides est disponible.
Cette activité fait partie du cours
Nettoyer des données avec R
Instructions de l’exercice
- Groupez
bike_share_ridesparride_idetdate. - Ajoutez une colonne nommée
duration_min_avgqui contient la durée moyenne du trajet pour leride_idet ladatede la ligne. - Supprimez les doublons selon
ride_idetdate, en conservant toutes les colonnes du tableau de données. - Retirez la colonne
duration_min.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
bike_share_rides %>%
# Group by ride_id and date
___ %>%
# Add duration_min_avg column
mutate(duration_min_avg = ___ ) %>%
# Remove duplicates based on ride_id and date, keep all cols
___ %>%
# Remove duration_min column
___(-___)