डुप्लिकेट्स खोजना
ride_sharing में फीड होने वाली डेटा पाइपलाइन के एक नए अपडेट ने ride_id कॉलम जोड़ा है, जो हर ride के लिए एक यूनिक पहचानकर्ता दर्शाता है.
हालाँकि इस अपडेट के साथ औसत ride duration बहुत कम हो गया है और कुछ उपयोगकर्ताओं के जन्म-वर्ष भविष्य में सेट दिखाई दे रहे हैं. सबसे अहम, एक रात में rides की संख्या 20% बढ़ गई है, जिससे आपको लगता है कि ride_sharing DataFrame में पूर्ण और अपूर्ण दोनों तरह के डुप्लिकेट्स हो सकते हैं.
इस अभ्यास में, आप उन डुप्लिकेट्स को ढूँढकर अपने संदेह की पुष्टि करेंगे. ride_sharing का एक sample आपके environment में उपलब्ध है, साथ ही अब तक उपयोग किए गए सभी पैकेज भी.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में डेटा क्लीनिंग
अभ्यास निर्देश
ride_sharingDataFrame मेंride_idकी डुप्लिकेट पंक्तियाँ ढूँढिए औरkeepकोFalseसेट कीजिए.duplicatesके आधार परride_sharingको सबसेट कीजिए,ride_idपर sort कीजिए, और परिणामduplicated_ridesमें असाइन कीजिए.duplicated_ridesसेride_id,durationऔरuser_birth_yearकॉलम्स को उसी क्रम में प्रिंट कीजिए.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Find duplicates
duplicates = ____.____(____, ____)
# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')
# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])