फाइलें ढूँढना
आप अपने ट्वीट्स डेटासेट की क्लीनिंग से संतुष्ट नहीं हैं. अब भी कुछ अतिरिक्त स्ट्रिंग्स हैं जो कोई सेंटिमेंट नहीं देतीं. इनमें वे स्ट्रिंग्स भी हैं जो टेक्स्ट फाइल नामों को दर्शाती हैं.
आपने उन्हें पहचानने का एक तरीका भी ढूँढ लिया है:
- वे स्ट्रिंग की शुरुआत में आती हैं.
- वे हमेशा 2 या 3 स्वर (a e i o u), बड़े या छोटे अक्षरों में, के सिक्वेंस से शुरू होती हैं.
- वे हमेशा
txtएंडिंग पर खत्म होती हैं.
आप सुनिश्चित नहीं हैं कि उन्हें सीधे हटा देना चाहिए. इसलिए आप उन्हें ढूँढने और एक अलग डेटासेट में सहेजने के लिए एक स्क्रिप्ट लिखते हैं.
आप कुछ मेटा-कैरेक्टर्स नोट कर लेते हैं जो मदद करेंगे: शुरुआत के लिए ^ एंकर, . कोई भी कैरेक्टर.
दो ट्वीट्स वाले टेक्स्ट की वैरिएबल sentiment_analysis और re मॉड्यूल पहले से ही आपके सेशन में लोड हैं. आप इसे देखने के लिए IPython Shell में print() का उपयोग कर सकते हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Regular Expressions
अभ्यास निर्देश
- एक regex लिखिए जो टेक्स्ट फाइल नामों के पैटर्न से मैच करे, जैसे
aemyfile.txt. sentiment_analysisके एलिमेंट्स में regex के सभी मैच ढूँढिए. परिणाम प्रिंट कीजिए.- regex के सभी मैच को खाली स्ट्रिंग
""से बदल दीजिए. परिणाम प्रिंट कीजिए.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Write a regex to match text file name
regex = ____"____[____]{____}____txt"
for text in sentiment_analysis:
# Find all matches of the regex
print(re.____(____, ____))
# Replace all matches with empty string
print(re.____(____, ____, ____))