在 Twitter 資料上使用字串運算子
你會繼續使用 tweets 資料,其中 text 欄位儲存每則推文的內容。
你的任務是把 text 欄位轉換成詞元(tokens)清單。接著,使用字串運算子,從建立的詞元清單中移除所有非英文字母的字元。
本練習屬於課程
Python 情感分析
練習說明
- 匯入文字斷詞函式。
- 從每則推文建立詞元。
- 從建立的清單中過濾掉所有非英文字母的字元,也就是只保留字母。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import the word tokenizing package
____
# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])
# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])