शुरू करेंमुफ़्त में शुरू करें

Partial duplicates को aggregate करना

Partial duplicates को संभालने का एक और तरीका है उन मानों का कोई summary statistic निकालना जो partial duplicates के बीच अलग हैं, जैसे mean, median, maximum, या minimum. यह तब उपयोगी होता है जब आपको पता न हो कि आपका डेटा कैसे इकट्ठा किया गया और आप औसत चाहते हों, या डोमेन ज्ञान के आधार पर, आप कम आँकने की बजाय थोड़ा अधिक आँकना पसंद करें (या इसके उलट).

dplyr लोड है और bike_share_rides उपलब्ध है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में डेटा क्लीनिंग

पाठ्यक्रम देखें

अभ्यास निर्देश

  • bike_share_rides को ride_id और date के आधार पर group करें.
  • duration_min_avg नाम का कॉलम जोड़ें जिसमें उस row के ride_id और date के लिए ride duration का mean हो.
  • ride_id और date के आधार पर duplicates हटाएँ, और डेटा फ्रेम के सभी कॉलम बनाए रखें.
  • duration_min कॉलम हटाएँ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

bike_share_rides %>%
  # Group by ride_id and date
  ___ %>%
  # Add duration_min_avg column
  mutate(duration_min_avg = ___ ) %>%
  # Remove duplicates based on ride_id and date, keep all cols
  ___ %>%
  # Remove duration_min column
  ___(-___)
कोड संपादित करें और चलाएँ