Kom igångKom igång gratis

Aggregera partiella dubbletter

Ett annat sätt att hantera partiella dubbletter är att beräkna ett sammanfattande statistikvärde för de värden som skiljer sig åt, till exempel medelvärde, median, maximum eller minimum. Det kan vara användbart när du är osäker på hur datan samlades in och vill ha ett genomsnitt, eller när du baserat på domänkunskap hellre vill ha en överskattning än en underskattning – eller tvärtom.

dplyr är inläst och bike_share_rides är tillgänglig.

Den här övningen är en del av kursen

Datarensning i R

Visa kurs

Övningsinstruktioner

  • Gruppera bike_share_rides efter ride_id och date.
  • Lägg till en kolumn som heter duration_min_avg med det genomsnittliga resans varaktighet för respektive ride_id och date.
  • Ta bort dubbletter baserat på ride_id och date, och behåll alla kolumner i dataramen.
  • Ta bort kolumnen duration_min.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

bike_share_rides %>%
  # Group by ride_id and date
  ___ %>%
  # Add duration_min_avg column
  mutate(duration_min_avg = ___ ) %>%
  # Remove duplicates based on ride_id and date, keep all cols
  ___ %>%
  # Remove duration_min column
  ___(-___)
Redigera och kör kod