ПочатиПочніть безкоштовно

Агрегування часткових дублікатів

Ще один спосіб обробки часткових дублікатів — обчислити зведену статистику для значень, які відрізняються між частковими дублікатами, наприклад середнє, медіану, максимум або мінімум. Це корисно, коли ви не певні, як було зібрано дані, і хочете отримати середнє значення, або якщо, спираючись на знання предметної області, вам краще мати завищену оцінку, ніж занижену (або навпаки).

dplyr завантажено, і bike_share_rides доступний.

Ця вправа є частиною курсу

Очищення даних в R

Переглянути курс

Інструкції до вправи

  • Згрупуйте bike_share_rides за ride_id та date.
  • Додайте стовпець duration_min_avg, який міститиме середню тривалість поїздки для ride_id та date цього рядка.
  • Видаліть дублікати на основі ride_id і date, залишивши всі стовпці датафрейму.
  • Видаліть стовпець duration_min.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

bike_share_rides %>%
  # Group by ride_id and date
  ___ %>%
  # Add duration_min_avg column
  mutate(duration_min_avg = ___ ) %>%
  # Remove duplicates based on ride_id and date, keep all cols
  ___ %>%
  # Remove duration_min column
  ___(-___)
Редагувати та запускати код