Kom igångKom igång gratis

Fullständiga dubbletter

Du har fått information om att en uppdatering gjorts i datapipelinen för cykeldelningsdata för att göra den mer effektiv, men att risken för att dubbletter genereras har ökat. För att kunna fortsätta använda samma skript i dina veckovisa analyser av resestatistik behöver du säkerställa att eventuella dubbletter i datamängden tas bort.

När flera rader i en dataram har samma värden i alla kolumner kallas de fullständiga dubbletter. Det är viktigt att ta bort sådana dubbletter, eftersom upprepade värden kan påverka sammanfattande statistik som medelvärde och median. Varje resa, inklusive dess ride_id, ska vara unik.

dplyr är inläst och bike_share_rides är tillgänglig.

Den här övningen är en del av kursen

Datarensning i R

Visa kurs

Övningsinstruktioner

  • Hämta det totala antalet fullständiga dubbletter i bike_share_rides.
  • Ta bort alla fullständiga dubbletter från bike_share_rides och spara den nya dataramen som bike_share_rides_unique.
  • Hämta det totala antalet fullständiga dubbletter i den nya dataramen bike_share_rides_unique.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Count the number of full duplicates
___

# Remove duplicates
bike_share_rides_unique <- ___

# Count the full duplicates in bike_share_rides_unique
___
Redigera och kör kod