शुरू करेंमुफ़्त में शुरू करें

फाइलें ढूँढना

आप अपने ट्वीट्स डेटासेट की क्लीनिंग से संतुष्ट नहीं हैं. अब भी कुछ अतिरिक्त स्ट्रिंग्स हैं जो कोई सेंटिमेंट नहीं देतीं. इनमें वे स्ट्रिंग्स भी हैं जो टेक्स्ट फाइल नामों को दर्शाती हैं.

आपने उन्हें पहचानने का एक तरीका भी ढूँढ लिया है:

  • वे स्ट्रिंग की शुरुआत में आती हैं.
  • वे हमेशा 2 या 3 स्वर (a e i o u), बड़े या छोटे अक्षरों में, के सिक्वेंस से शुरू होती हैं.
  • वे हमेशा txt एंडिंग पर खत्म होती हैं.

आप सुनिश्चित नहीं हैं कि उन्हें सीधे हटा देना चाहिए. इसलिए आप उन्हें ढूँढने और एक अलग डेटासेट में सहेजने के लिए एक स्क्रिप्ट लिखते हैं.

आप कुछ मेटा-कैरेक्टर्स नोट कर लेते हैं जो मदद करेंगे: शुरुआत के लिए ^ एंकर, . कोई भी कैरेक्टर.

दो ट्वीट्स वाले टेक्स्ट की वैरिएबल sentiment_analysis और re मॉड्यूल पहले से ही आपके सेशन में लोड हैं. आप इसे देखने के लिए IPython Shell में print() का उपयोग कर सकते हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Regular Expressions

पाठ्यक्रम देखें

अभ्यास निर्देश

  • एक regex लिखिए जो टेक्स्ट फाइल नामों के पैटर्न से मैच करे, जैसे aemyfile.txt.
  • sentiment_analysis के एलिमेंट्स में regex के सभी मैच ढूँढिए. परिणाम प्रिंट कीजिए.
  • regex के सभी मैच को खाली स्ट्रिंग "" से बदल दीजिए. परिणाम प्रिंट कीजिए.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Write a regex to match text file name
regex = ____"____[____]{____}____txt"

for text in sentiment_analysis:
	# Find all matches of the regex
	print(re.____(____, ____))
    
	# Replace all matches with empty string
	print(re.____(____, ____, ____))
कोड संपादित करें और चलाएँ