Partial duplicates को aggregate करना
Partial duplicates को संभालने का एक और तरीका है उन मानों का कोई summary statistic निकालना जो partial duplicates के बीच अलग हैं, जैसे mean, median, maximum, या minimum. यह तब उपयोगी होता है जब आपको पता न हो कि आपका डेटा कैसे इकट्ठा किया गया और आप औसत चाहते हों, या डोमेन ज्ञान के आधार पर, आप कम आँकने की बजाय थोड़ा अधिक आँकना पसंद करें (या इसके उलट).
dplyr लोड है और bike_share_rides उपलब्ध है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में डेटा क्लीनिंग
अभ्यास निर्देश
bike_share_ridesकोride_idऔरdateके आधार पर group करें.duration_min_avgनाम का कॉलम जोड़ें जिसमें उस row केride_idऔरdateके लिए ride duration का mean हो.ride_idऔरdateके आधार पर duplicates हटाएँ, और डेटा फ्रेम के सभी कॉलम बनाए रखें.duration_minकॉलम हटाएँ.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
bike_share_rides %>%
# Group by ride_id and date
___ %>%
# Add duration_min_avg column
mutate(duration_min_avg = ___ ) %>%
# Remove duplicates based on ride_id and date, keep all cols
___ %>%
# Remove duration_min column
___(-___)