Gộp các bản sao một phần
Một cách khác để xử lý các bản sao một phần là tính một thống kê tóm tắt cho các giá trị khác nhau giữa các bản sao này, chẳng hạn như trung bình, trung vị, giá trị lớn nhất hoặc nhỏ nhất. Cách làm này hữu ích khi bạn không chắc dữ liệu được thu thập như thế nào và muốn lấy giá trị trung bình; hoặc dựa trên hiểu biết miền, bạn muốn ước lượng hơi cao hơn thay vì quá thấp (hoặc ngược lại).
dplyr đã được nạp và bike_share_rides đã sẵn sàng.
Bài tập này là một phần của khóa học
Làm sạch dữ liệu trong R
Hướng dẫn bài tập
- Nhóm
bike_share_ridestheoride_idvàdate. - Thêm một cột tên
duration_min_avgchứa thời lượng chuyến đi trung bình choride_idvàdatecủa dòng đó. - Xóa các bản trùng lặp dựa trên
ride_idvàdate, đồng thời giữ tất cả các cột của data frame. - Xóa cột
duration_min.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
bike_share_rides %>%
# Group by ride_id and date
___ %>%
# Add duration_min_avg column
mutate(duration_min_avg = ___ ) %>%
# Remove duplicates based on ride_id and date, keep all cols
___ %>%
# Remove duration_min column
___(-___)