Агрегирование частичных дубликатов
Ещё один способ работы с частичными дубликатами — вычислить сводную статистику по значениям, которые различаются между ними: например, среднее, медиану, максимум или минимум. Это удобно, когда вы не знаете точно, как были собраны данные и хотите получить среднюю оценку, или когда на основе экспертных знаний вы предпочитаете завышенную оценку заниженной (или наоборот).
Библиотека dplyr загружена, набор данных bike_share_rides доступен.
Это упражнение является частью курса
Очистка данных в R
Инструкции к упражнению
- Сгруппируйте
bike_share_ridesпо столбцамride_idиdate. - Добавьте столбец
duration_min_avg, содержащий среднюю продолжительность поездки для каждой комбинацииride_idиdate. - Удалите дубликаты по столбцам
ride_idиdate, сохранив все столбцы фрейма данных. - Удалите столбец
duration_min.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
bike_share_rides %>%
# Group by ride_id and date
___ %>%
# Add duration_min_avg column
mutate(duration_min_avg = ___ ) %>%
# Remove duplicates based on ride_id and date, keep all cols
___ %>%
# Remove duration_min column
___(-___)