or
यह अभ्यास पाठ्यक्रम का हिस्सा है
इस अध्याय में, आप सबसे आम गंदे डेटा समस्याओं से निपटना सीखेंगे. आप डेटा टाइप बदलेंगे, भविष्य की data points को हटाने के लिए रेंज constraints लागू करेंगे, और डबल-काउंटिंग से बचने के लिए डुप्लिकेट data points हटाएँगे.
श्रेणीगत और टेक्स्ट डेटा अक्सर अपनी असंरचित प्रकृति के कारण डेटासेट के सबसे अव्यवस्थित हिस्से होते हैं. इस अध्याय में, आप category labels में whitespace और capitalization की असंगतियों को ठीक करना, कई categories को मिलाकर एक बनाना, और consistency के लिए strings को फिर से फ़ॉर्मैट करना सीखेंगे.
इस अध्याय में, आप और उन्नत डेटा क्लीनिंग समस्याओं में उतरेंगे, जैसे यह सुनिश्चित करना कि वज़न पाउंड्स की बजाय सभी किलोग्राम में लिखे हों. आप ऐसी उपयोगी स्किल्स भी सीखेंगे जो यह सत्यापित करने में मदद करेंगी कि मान सही तरह जोड़े गए हैं और missing values आपके analyses को नकारात्मक रूप से प्रभावित न करें.
वर्तमान अभ्यास
Record linkage एक शक्तिशाली तकनीक है जिसका उपयोग कई डेटासेट्स को मर्ज करने में किया जाता है, खासकर तब जब मानों में टाइपो या अलग वर्तनी हों. इस अध्याय में, आप strings के बीच similarity निकालकर रिकॉर्ड्स को लिंक करना सीखेंगे—फिर आप अपनी नई स्किल्स का उपयोग करके दो रेस्तरां रिव्यू डेटासेट्स को जोड़कर एक साफ़ master डेटासेट बनाएँगे.