Agregace částečných duplikátů
Dalším způsobem, jak pracovat s částečnými duplikáty, je vypočítat souhrnnou statistiku hodnot, které se mezi nimi liší – například průměr, medián, maximum nebo minimum. To se hodí, když si nejsi jistý/jistá, jak byla data sbírána a chceš pracovat s průměrem, nebo když na základě znalosti domény preferuješ spíše nadhodnocený než podhodnocený odhad (nebo naopak).
dplyr je načtený a bike_share_rides je k dispozici.
Toto cvičení je součástí kurzu
Čištění dat v R
Pokyny k cvičení
- Seskup
bike_share_ridespodleride_idadate. - Přidej sloupec
duration_min_avg, který bude obsahovat průměrnou délku jízdy pro danéride_idadate. - Odstraň duplikáty na základě
ride_idadatea zachovej všechny sloupce datového rámce. - Odstraň sloupec
duration_min.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
bike_share_rides %>%
# Group by ride_id and date
___ %>%
# Add duration_min_avg column
mutate(duration_min_avg = ___ ) %>%
# Remove duplicates based on ride_id and date, keep all cols
___ %>%
# Remove duration_min column
___(-___)