Bản sao đầy đủ
Bạn vừa được thông báo rằng pipeline dữ liệu chia sẻ xe đạp đã được cập nhật để hiệu quả hơn, nhưng vì thế khả năng phát sinh bản sao cũng cao hơn. Để tiếp tục dùng cùng các script cho phân tích hàng tuần về thống kê chuyến đi, bạn cần đảm bảo mọi bản sao trong bộ dữ liệu được loại bỏ trước.
Khi nhiều hàng trong một data frame có cùng giá trị ở tất cả các cột, chúng là bản sao đầy đủ của nhau. Việc loại bỏ những bản sao này rất quan trọng, vì lặp lại cùng một giá trị nhiều lần có thể làm sai lệch các thống kê tóm tắt như mean và median. Mỗi chuyến đi, bao gồm ride_id, phải là duy nhất.
dplyr đã được nạp và bike_share_rides đã sẵn sàng.
Bài tập này là một phần của khóa học
Làm sạch dữ liệu trong R
Hướng dẫn bài tập
- Lấy tổng số bản sao đầy đủ trong
bike_share_rides. - Loại bỏ mọi bản sao đầy đủ khỏi
bike_share_ridesvà lưu data frame mới làbike_share_rides_unique. - Lấy tổng số bản sao đầy đủ trong data frame mới
bike_share_rides_unique.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Count the number of full duplicates
___
# Remove duplicates
bike_share_rides_unique <- ___
# Count the full duplicates in bike_share_rides_unique
___