Повні дублікати
Вас повідомили, що конвеєр обробки даних із прокату велосипедів оновлено для підвищення ефективності, але через це ймовірність появи дублікатів зросла. Щоб і надалі використовувати ті самі скрипти для щотижневого аналізу статистики поїздок, спершу потрібно переконатися, що з набору даних видалено всі дублікати.
Коли кілька рядків датафрейма мають однакові значення в усіх стовпцях, це повні дублікати один одного. Видаляти такі дублікати важливо, адже повторювані значення можуть спотворити підсумкові показники, як-от середнє та медіану. Кожна поїздка, зокрема її ride_id, має бути унікальною.
dplyr завантажено, і bike_share_rides доступний.
Ця вправа є частиною курсу
Очищення даних в R
Інструкції до вправи
- Отримайте загальну кількість повних дублікатів у
bike_share_rides. - Видаліть усі повні дублікати з
bike_share_ridesі збережіть новий датафрейм якbike_share_rides_unique. - Отримайте загальну кількість повних дублікатів у новому датафреймі
bike_share_rides_unique.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Count the number of full duplicates
___
# Remove duplicates
bike_share_rides_unique <- ___
# Count the full duplicates in bike_share_rides_unique
___