Agregarea duplicatelor parțiale
O altă modalitate de a gestiona duplicatele parțiale este să calculezi o statistică de sumarizare pentru valorile care diferă între ele – de exemplu, media, mediana, maximul sau minimul. Acest lucru poate fi util atunci când nu ești sigur cum au fost colectate datele și preferi o valoare medie, sau când, pe baza cunoștințelor din domeniu, vrei o estimare mai degrabă ridicată decât scăzută (sau invers).
dplyr este încărcat și bike_share_rides este disponibil.
Acest exercițiu face parte din cursul
Curățarea datelor în R
Instrucțiuni pentru exercițiu
- Grupează
bike_share_ridesdupăride_idșidate. - Adaugă o coloană numită
duration_min_avgcare conține durata medie a curselor pentruride_idșidatedin rândul respectiv. - Elimină duplicatele pe baza
ride_idșidate, păstrând toate coloanele din cadrul de date. - Elimină coloana
duration_min.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
bike_share_rides %>%
# Group by ride_id and date
___ %>%
# Add duration_min_avg column
mutate(duration_min_avg = ___ ) %>%
# Remove duplicates based on ride_id and date, keep all cols
___ %>%
# Remove duration_min column
___(-___)