अपने टेक्स्ट को साफ़ करना
असंरचित टेक्स्ट डेटा को सीधे अधिकतर विश्लेषणों में उपयोग नहीं किया जा सकता। किसी लंबे फ्री-फॉर्म स्ट्रिंग से सही फ़ॉर्मेट वाले न्यूमेरिक कॉलमों के सेट तक पहुँचने के लिए कई चरणों की ज़रूरत होती है, जिन्हें मशीन लर्निंग मॉडल इनजेस्ट कर सके। इस प्रक्रिया का पहला चरण है डेटा को मानकीकृत करना और ऐसे किसी भी कैरेक्टर को हटाना जो आपकी एनालिटिक पाइपलाइन में आगे चलकर समस्या पैदा कर सकते हैं।
इस अध्याय में आप एक नए डेटासेट के साथ काम करेंगे जिसमें संयुक्त राज्य अमेरिका के राष्ट्रपति के उद्घाटन भाषण शामिल हैं, जिसे speech_df के रूप में लोड किया गया है, और भाषण text कॉलम में स्टोर हैं।
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में मशीन लर्निंग के लिए फीचर इंजीनियरिंग
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Print the first 5 rows of the text column
print(____)