Agregar duplicados parciales
Otra forma de tratar los duplicados parciales es calcular una estadística resumen de los valores que difieren entre los duplicados parciales, como la media, la mediana, el valor máximo o el mínimo. Esto puede ser útil cuando no tienes claro cómo se recopilaron tus datos y quieres un promedio, o si, basándote en el conocimiento del dominio, prefieres sobreestimar antes que infraestimar (o al revés).
dplyr está cargado y bike_share_rides está disponible.
Este ejercicio forma parte del curso
Limpieza de datos en R
Instrucciones del ejercicio
- Agrupa
bike_share_ridesporride_idydate. - Añade una columna llamada
duration_min_avgque contenga la media de la duración del viaje para elride_idydatede la fila. - Elimina los duplicados basándote en
ride_idydate, conservando todas las columnas del marco de datos. - Elimina la columna
duration_min.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
bike_share_rides %>%
# Group by ride_id and date
___ %>%
# Add duration_min_avg column
mutate(duration_min_avg = ___ ) %>%
# Remove duplicates based on ride_id and date, keep all cols
___ %>%
# Remove duration_min column
___(-___)