Full duplicates
आपको सूचित किया गया है कि bike sharing डेटा पाइपलाइन को अधिक कुशल बनाने के लिए अपडेट किया गया है, लेकिन इसके परिणामस्वरूप डुप्लिकेट्स बनने की संभावना अधिक है. यह सुनिश्चित करने के लिए कि आप अपनी साप्ताहिक ride आँकड़ों की विश्लेषण रिपोर्ट चलाने के लिए वही स्क्रिप्ट्स इस्तेमाल करते रहें, आपको पहले डेटासेट में मौजूद किसी भी डुप्लिकेट को हटाना होगा.
जब किसी data frame की कई पंक्तियों में सभी कॉलम्स के मान एक जैसे हों, तो वे एक-दूसरे की full duplicates होती हैं. ऐसे डुप्लिकेट्स हटाना ज़रूरी है, क्योंकि एक ही मान का कई बार दोहराव mean और median जैसे summary statistics को बदल सकता है. हर ride, उसके ride_id सहित, यूनिक होनी चाहिए.
dplyr लोड है और bike_share_rides उपलब्ध है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में डेटा क्लीनिंग
अभ्यास निर्देश
bike_share_ridesमें full duplicates की कुल संख्या निकालें.bike_share_ridesसे सभी full duplicates हटाकर नए data frame कोbike_share_rides_uniqueनाम से सेव करें.- नए
bike_share_rides_uniquedata frame में full duplicates की कुल संख्या निकालें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Count the number of full duplicates
___
# Remove duplicates
bike_share_rides_unique <- ___
# Count the full duplicates in bike_share_rides_unique
___