Агрегування часткових дублікатів
Ще один спосіб обробки часткових дублікатів — обчислити зведену статистику для значень, які відрізняються між частковими дублікатами, наприклад середнє, медіану, максимум або мінімум. Це корисно, коли ви не певні, як було зібрано дані, і хочете отримати середнє значення, або якщо, спираючись на знання предметної області, вам краще мати завищену оцінку, ніж занижену (або навпаки).
dplyr завантажено, і bike_share_rides доступний.
Ця вправа є частиною курсу
Очищення даних в R
Інструкції до вправи
- Згрупуйте
bike_share_ridesзаride_idтаdate. - Додайте стовпець
duration_min_avg, який міститиме середню тривалість поїздки дляride_idтаdateцього рядка. - Видаліть дублікати на основі
ride_idіdate, залишивши всі стовпці датафрейму. - Видаліть стовпець
duration_min.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
bike_share_rides %>%
# Group by ride_id and date
___ %>%
# Add duration_min_avg column
mutate(duration_min_avg = ___ ) %>%
# Remove duplicates based on ride_id and date, keep all cols
___ %>%
# Remove duration_min column
___(-___)