एक और नाम आज़माएँ
आप अभी भी अपने Twitter sentiment analysis पर काम कर रहे हैं. अब आप उन बातों का विश्लेषण कर रहे हैं जिन्होंने आपका ध्यान खींचा. आपने नोटिस किया कि कुछ ट्वीट्स में ईमेल पते डले हुए हैं. अब, आप जानना चाहते हैं कि सबसे आम नाम कौन सा है.
आप ईमेल का पहला हिस्सा निकालना चाहते हैं. जैसे, अगर आपके पास ईमेल [email protected] है, तो आपको सिर्फ marysmith90 में दिलचस्पी है.
आपको पूरी अभिव्यक्ति (expression) को मैच करना है. ताकि सुनिश्चित हो कि केवल वही नाम निकले जो ईमेल में मौजूद हैं. साथ ही, आपको केवल ऐसे नाम चाहिए जिनमें अपरकेस (जैसे A, B, Z) या लोअरकेस अक्षर (जैसे a, d, z) और अंक हों.
तीन ट्वीट्स के टेक्स्ट वाली सूची sentiment_analysis और re मॉड्यूल आपकी सेशन में लोड किए गए हैं. आप इसे देखने के लिए IPython Shell में print() का उपयोग कर सकते हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Regular Expressions
अभ्यास निर्देश
- regex को पूरा करें ताकि ईमेल में से सिर्फ नाम वाला हिस्सा capture हो. नाम का हिस्सा
@से पहले आता है. sentiment_analysisकी प्रत्येक एंट्री में regex के सभी matches ढूँढें. इसे वैरिएबलemail_matchedको असाइन करें..format()मेथड को पूरा करें ताकिsentiment_analysisके प्रत्येक एलिमेंट में capture हुए नतीजे प्रिंट हों.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Write a regex that matches email
regex_email = r"___[____]____\S+"
for tweet in sentiment_analysis:
# Find all matches of regex in each tweet
email_matched = re.____(____, ____)
# Complete the format method to print the results
print("Lists of users found in this tweet: {}".format(____))