Duplicados completos
Te han avisado de que se ha actualizado el pipeline de datos de bike sharing para hacerlo más eficiente, pero que es más probable que se generen duplicados como consecuencia. Para poder seguir usando los mismos scripts en tus análisis semanales de estadísticas de trayectos, primero tendrás que asegurarte de eliminar cualquier duplicado del conjunto de datos.
Cuando varias filas de un data frame comparten los mismos valores en todas las columnas, son duplicados completos entre sí. Eliminar este tipo de duplicados es importante, porque tener el mismo valor repetido varias veces puede alterar estadísticas de resumen como la media y la mediana. Cada trayecto, incluido su ride_id, debe ser único.
dplyr está cargado y bike_share_rides está disponible.
Este ejercicio forma parte del curso
Limpieza de datos en R
Instrucciones del ejercicio
- Obtén el número total de duplicados completos en
bike_share_rides. - Elimina todos los duplicados completos de
bike_share_ridesy guarda el nuevo data frame comobike_share_rides_unique. - Obtén el número total de duplicados completos en el nuevo data frame
bike_share_rides_unique.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Count the number of full duplicates
___
# Remove duplicates
bike_share_rides_unique <- ___
# Count the full duplicates in bike_share_rides_unique
___