शुरू करेंमुफ़्त में शुरू करें

Twitter डेटा के साथ string ऑपरेटर्स

आप tweets डेटा पर काम जारी रख रहे हैं, जहाँ text कॉलम में हर ट्वीट की सामग्री होती है.

आपका काम है text कॉलम को टोकन्स की एक सूची में बदलना. फिर, string ऑपरेटर्स का उपयोग करके, बनी हुई टोकन्स सूची से सभी non-alphabetic कैरेक्टर्स हटा दें.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Sentiment Analysis

पाठ्यक्रम देखें

अभ्यास निर्देश

  • Word tokenizing फंक्शन इम्पोर्ट करें.
  • हर ट्वीट से word tokens बनाएँ.
  • बनी हुई सूची से सभी non-alphabetic कैरेक्टर्स फ़िल्टर कर दें, अर्थात् सिर्फ अक्षर रखें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import the word tokenizing package
____

# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])

# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])
कोड संपादित करें और चलाएँ