Fullständiga dubbletter
Du har fått information om att en uppdatering gjorts i datapipelinen för cykeldelningsdata för att göra den mer effektiv, men att risken för att dubbletter genereras har ökat. För att kunna fortsätta använda samma skript i dina veckovisa analyser av resestatistik behöver du säkerställa att eventuella dubbletter i datamängden tas bort.
När flera rader i en dataram har samma värden i alla kolumner kallas de fullständiga dubbletter. Det är viktigt att ta bort sådana dubbletter, eftersom upprepade värden kan påverka sammanfattande statistik som medelvärde och median. Varje resa, inklusive dess ride_id, ska vara unik.
dplyr är inläst och bike_share_rides är tillgänglig.
Den här övningen är en del av kursen
Datarensning i R
Övningsinstruktioner
- Hämta det totala antalet fullständiga dubbletter i
bike_share_rides. - Ta bort alla fullständiga dubbletter från
bike_share_ridesoch spara den nya dataramen sombike_share_rides_unique. - Hämta det totala antalet fullständiga dubbletter i den nya dataramen
bike_share_rides_unique.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Count the number of full duplicates
___
# Remove duplicates
bike_share_rides_unique <- ___
# Count the full duplicates in bike_share_rides_unique
___