शुरू करेंमुफ़्त में शुरू करें

Tokens निकालना

आपका अगला कदम अपने ट्वीट्स के टेक्स्ट को टोकनाइज़ करना है। Tokenization वह प्रक्रिया है जिसमें किसी string को लेक्सिकल यूनिट्स में तोड़ा जाता है — आसान शब्दों में कहें, शब्दों में। लेकिन पहले, आपको हैशटैग्स हटाने होंगे ताकि वे आपकी प्रक्रिया में बाधा न डालें। आपने देखा कि हैशटैग # सिंबल से शुरू होते हैं और इनमें अक्षर व नंबर होते हैं, लेकिन कभी भी whitespace नहीं होता। उसके बाद, आप whitespace के मैच पर टेक्स्ट को स्प्लिट करके tokens निकालने की योजना बनाते हैं.

आप अपने quantifiers की सूची साथ लाए हैं: * शून्य या अधिक बार, + एक या अधिक बार, ? शून्य या एक बार, {n, m} न्यूनतम n, अधिकतम m.

वैरिएबल sentiment_analysis जिसमें एक ट्वीट का टेक्स्ट है, और re मॉड्यूल, दोनों पहले से आपके सेशन में लोड हैं। आप IPython Shell में इसे देखने के लिए print(sentiment_analysis) का उपयोग कर सकते हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Regular Expressions

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Write a regex matching the hashtag pattern
regex = r"____"
कोड संपादित करें और चलाएँ