Začněte nyníZačněte zdarma

Agregace částečných duplikátů

Dalším způsobem, jak pracovat s částečnými duplikáty, je vypočítat souhrnnou statistiku hodnot, které se mezi nimi liší – například průměr, medián, maximum nebo minimum. To se hodí, když si nejsi jistý/jistá, jak byla data sbírána a chceš pracovat s průměrem, nebo když na základě znalosti domény preferuješ spíše nadhodnocený než podhodnocený odhad (nebo naopak).

dplyr je načtený a bike_share_rides je k dispozici.

Toto cvičení je součástí kurzu

Čištění dat v R

Zobrazit kurz

Pokyny k cvičení

  • Seskup bike_share_rides podle ride_id a date.
  • Přidej sloupec duration_min_avg, který bude obsahovat průměrnou délku jízdy pro dané ride_id a date.
  • Odstraň duplikáty na základě ride_id a date a zachovej všechny sloupce datového rámce.
  • Odstraň sloupec duration_min.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

bike_share_rides %>%
  # Group by ride_id and date
  ___ %>%
  # Add duration_min_avg column
  mutate(duration_min_avg = ___ ) %>%
  # Remove duplicates based on ride_id and date, keep all cols
  ___ %>%
  # Remove duration_min column
  ___(-___)
Upravit a spustit kód