EmpezarEmpieza gratis

Agregar duplicados parciales

Otra forma de tratar los duplicados parciales es calcular una estadística resumen de los valores que difieren entre los duplicados parciales, como la media, la mediana, el valor máximo o el mínimo. Esto puede ser útil cuando no tienes claro cómo se recopilaron tus datos y quieres un promedio, o si, basándote en el conocimiento del dominio, prefieres sobreestimar antes que infraestimar (o al revés).

dplyr está cargado y bike_share_rides está disponible.

Este ejercicio forma parte del curso

Limpieza de datos en R

Ver curso

Instrucciones del ejercicio

  • Agrupa bike_share_rides por ride_id y date.
  • Añade una columna llamada duration_min_avg que contenga la media de la duración del viaje para el ride_id y date de la fila.
  • Elimina los duplicados basándote en ride_id y date, conservando todas las columnas del marco de datos.
  • Elimina la columna duration_min.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

bike_share_rides %>%
  # Group by ride_id and date
  ___ %>%
  # Add duration_min_avg column
  mutate(duration_min_avg = ___ ) %>%
  # Remove duplicates based on ride_id and date, keep all cols
  ___ %>%
  # Remove duration_min column
  ___(-___)
Editar y ejecutar código