सब कुछ साफ़
अपने Twitter सेंटिमेंट एनालिसिस प्रोजेक्ट पर वापस चलिए! ऐसी कई तरह की स्ट्रिंग्स होती हैं जो आपके विश्लेषण को जटिल बनाती हैं, लेकिन उनसे कोई उपयोगी सेंटिमेंट नहीं मिलता. इनमें लिंक और यूज़र मेंशन शामिल हो सकते हैं.
ट्वीट्स को साफ़ करने के लिए, आप पहले कुछ उदाहरण निकालना चाहते हैं. आपको पता है कि ज़्यादातर बार लिंक http से शुरू होते हैं और उनमें कोई whitespace नहीं होता, जैसे https://www.datacamp.com. यूज़र मेंशन @ से शुरू होते हैं और उनमें केवल अक्षर और संख्याएँ हो सकती हैं, जैसे @johnsmith3.
आप कुछ सहायक quantifiers नोट करते हैं: * शून्य या अधिक बार, + एक या अधिक बार, ? शून्य या एक बार.
तीन ट्वीट्स के टेक्स्ट वाली लिस्ट sentiment_analysis पहले से आपकी सेशन में लोड है. IPython Shell में डेटा देखने के लिए आप print() का उपयोग कर सकते हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Regular Expressions
अभ्यास निर्देश
reमॉड्यूल इम्पोर्ट करें.sentiment_analysisकी प्रत्येकtweetमें आने वालेhttpलिंक के सभी मैच ढूँढ़ने के लिए एक regex लिखें. रिज़ल्ट प्रिंट करें.sentiment_analysisकी प्रत्येकtweetमें आने वाले यूज़र मेंशन के सभी मैच ढूँढ़ने के लिए एक regex लिखें. रिज़ल्ट प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import re module
____
for tweet in sentiment_analysis:
# Write regex to match http links and print out result
print(re.____(____"____", ____))
# Write regex to match user mentions and print out result
print(re.____(____"____", ____))