शुरू करेंमुफ़्त में शुरू करें

मैच और स्प्लिट

आपके डेटासेट में कुछ ट्वीट्स गलत तरीके से डाउनलोड हो गए हैं। शब्दों के बीच स्पेस होने के बजाय, उनमें अजीब कैरेक्टर्स आ गए हैं। आप यह स्थिति संभालने के लिए रेगुलर एक्सप्रेशंस का उपयोग करने का निर्णय लेते हैं। आप कुछ ट्वीट्स प्रिंट करके देखते हैं ताकि समझ सकें कि किस पैटर्न को मैच करना है.

आप देखते हैं कि वाक्य हमेशा एक स्पेशल कैरेक्टर, फिर एक संख्या, उसके बाद शब्द break, और उसके बाद एक और स्पेशल कैरेक्टर से अलग होते हैं, जैसे &4break!। शब्द हमेशा एक स्पेशल कैरेक्टर, शब्द new, और उसके बाद कोई साधारण रैंडम कैरेक्टर से अलग होते हैं, जैसे #newH.

एक ट्वीट का टेक्स्ट रखने वाला वैरिएबल sentiment_analysis और re मॉड्यूल आपकी सेशन में पहले से लोड हैं। आप print(sentiment_analysis) का उपयोग करके इसे IPython शेल में देख सकते हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Regular Expressions

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Write a regex to match pattern separating sentences
regex_sentence = ____"____"
कोड संपादित करें और चलाएँ