ПочатиПочніть безкоштовно

Повні дублікати

Вас повідомили, що конвеєр обробки даних із прокату велосипедів оновлено для підвищення ефективності, але через це ймовірність появи дублікатів зросла. Щоб і надалі використовувати ті самі скрипти для щотижневого аналізу статистики поїздок, спершу потрібно переконатися, що з набору даних видалено всі дублікати.

Коли кілька рядків датафрейма мають однакові значення в усіх стовпцях, це повні дублікати один одного. Видаляти такі дублікати важливо, адже повторювані значення можуть спотворити підсумкові показники, як-от середнє та медіану. Кожна поїздка, зокрема її ride_id, має бути унікальною.

dplyr завантажено, і bike_share_rides доступний.

Ця вправа є частиною курсу

Очищення даних в R

Переглянути курс

Інструкції до вправи

  • Отримайте загальну кількість повних дублікатів у bike_share_rides.
  • Видаліть усі повні дублікати з bike_share_rides і збережіть новий датафрейм як bike_share_rides_unique.
  • Отримайте загальну кількість повних дублікатів у новому датафреймі bike_share_rides_unique.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Count the number of full duplicates
___

# Remove duplicates
bike_share_rides_unique <- ___

# Count the full duplicates in bike_share_rides_unique
___
Редагувати та запускати код