or
यह अभ्यास पाठ्यक्रम का हिस्सा है
इस अध्याय में, आप कुछ सबसे आम गंदे डेटा समस्याओं से निपटना सीखेंगे। आप डेटा टाइप्स कनवर्ट करेंगे, भविष्य की तिथियों जैसे पॉइंट्स हटाने के लिए रेंज constraints लागू करेंगे, और डुप्लीकेटेड डेटा पॉइंट्स हटाएँगे ताकि डबल-काउंटिंग से बचा जा सके।
अनस्ट्रक्चर्ड प्रकृति के कारण, श्रेणीगत और टेक्स्ट डेटा अक्सर किसी भी डेटासेट के सबसे गंदे हिस्से होते हैं। इस अध्याय में, आप कैटेगरी लेबल्स में whitespace और कैपिटलाइज़ेशन की असंगतियों को ठीक करना, कई कैटेगरीज को मिलाकर एक बनाना, और consistency के लिए strings को रीफ़ॉर्मैट करना सीखेंगे।
इस अध्याय में, आप और अधिक एडवांस्ड डेटा क्लीनिंग समस्याओं में गहराई से जाएँगे, जैसे यह सुनिश्चित करना कि वज़न पाउंड्स की बजाय सभी किलोग्राम में लिखे हों। आप वे अहम स्किल्स भी सीखेंगे जो यह सत्यापित करने में मदद करती हैं कि मान सही तरह से जोड़े गए हैं, और मिसिंग वैल्यूज़ आपके विश्लेषण पर नकारात्मक प्रभाव न डालें।
वर्तमान अभ्यास
रिकॉर्ड लिंकेज एक शक्तिशाली तकनीक है जिसका उपयोग कई डेटासेट्स को आपस में मर्ज करने के लिए किया जाता है, खासकर जब मानों में टाइपो या अलग-अलग स्पेलिंग हों। इस अध्याय में, आप strings के बीच similarity की गणना करके रिकॉर्ड्स को लिंक करना सीखेंगे—फिर आप अपनी नई स्किल्स का उपयोग करके दो रेस्तरां रिव्यू डेटासेट्स को जोड़कर एक साफ़ मास्टर डेटासेट बनाएँगे।