НачатьНачать бесплатно

Полные дубликаты

Вам сообщили, что в конвейер обработки данных о велопрокате были внесены изменения для повышения эффективности, однако теперь вероятность появления дубликатов возросла. Чтобы и дальше использовать те же скрипты для еженедельного анализа статистики поездок, необходимо предварительно удалять дубликаты из набора данных.

Если несколько строк фрейма данных содержат одинаковые значения во всех столбцах, они являются полными дубликатами друг друга. Удалять такие дубликаты важно, поскольку повторяющиеся значения могут искажать сводную статистику — например, среднее значение и медиану. Каждая поездка, включая её ride_id, должна быть уникальной.

Пакет dplyr загружен, набор данных bike_share_rides доступен.

Это упражнение является частью курса

Очистка данных в R

Посмотреть курс

Инструкции к упражнению

  • Определите общее количество полных дубликатов в bike_share_rides.
  • Удалите все полные дубликаты из bike_share_rides и сохраните полученный фрейм данных под именем bike_share_rides_unique.
  • Определите общее количество полных дубликатов в новом фрейме данных bike_share_rides_unique.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Count the number of full duplicates
___

# Remove duplicates
bike_share_rides_unique <- ___

# Count the full duplicates in bike_share_rides_unique
___
Редактировать и запускать код