НачатьНачать бесплатно

Агрегирование частичных дубликатов

Ещё один способ работы с частичными дубликатами — вычислить сводную статистику по значениям, которые различаются между ними: например, среднее, медиану, максимум или минимум. Это удобно, когда вы не знаете точно, как были собраны данные и хотите получить среднюю оценку, или когда на основе экспертных знаний вы предпочитаете завышенную оценку заниженной (или наоборот).

Библиотека dplyr загружена, набор данных bike_share_rides доступен.

Это упражнение является частью курса

Очистка данных в R

Посмотреть курс

Инструкции к упражнению

  • Сгруппируйте bike_share_rides по столбцам ride_id и date.
  • Добавьте столбец duration_min_avg, содержащий среднюю продолжительность поездки для каждой комбинации ride_id и date.
  • Удалите дубликаты по столбцам ride_id и date, сохранив все столбцы фрейма данных.
  • Удалите столбец duration_min.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

bike_share_rides %>%
  # Group by ride_id and date
  ___ %>%
  # Add duration_min_avg column
  mutate(duration_min_avg = ___ ) %>%
  # Remove duplicates based on ride_id and date, keep all cols
  ___ %>%
  # Remove duration_min column
  ___(-___)
Редактировать и запускать код