Aggregera partiella dubbletter
Ett annat sätt att hantera partiella dubbletter är att beräkna ett sammanfattande statistikvärde för de värden som skiljer sig åt, till exempel medelvärde, median, maximum eller minimum. Det kan vara användbart när du är osäker på hur datan samlades in och vill ha ett genomsnitt, eller när du baserat på domänkunskap hellre vill ha en överskattning än en underskattning – eller tvärtom.
dplyr är inläst och bike_share_rides är tillgänglig.
Den här övningen är en del av kursen
Datarensning i R
Övningsinstruktioner
- Gruppera
bike_share_ridesefterride_idochdate. - Lägg till en kolumn som heter
duration_min_avgmed det genomsnittliga resans varaktighet för respektiveride_idochdate. - Ta bort dubbletter baserat på
ride_idochdate, och behåll alla kolumner i dataramen. - Ta bort kolumnen
duration_min.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
bike_share_rides %>%
# Group by ride_id and date
___ %>%
# Add duration_min_avg column
mutate(duration_min_avg = ___ ) %>%
# Remove duplicates based on ride_id and date, keep all cols
___ %>%
# Remove duration_min column
___(-___)