開始使用免費開始

在 Twitter 資料上使用字串運算子

你會繼續使用 tweets 資料,其中 text 欄位儲存每則推文的內容。

你的任務是把 text 欄位轉換成詞元(tokens)清單。接著,使用字串運算子,從建立的詞元清單中移除所有非英文字母的字元。

本練習屬於課程

Python 情感分析

檢視課程

練習說明

  • 匯入文字斷詞函式。
  • 從每則推文建立詞元。
  • 從建立的清單中過濾掉所有非英文字母的字元,也就是只保留字母。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import the word tokenizing package
____

# Tokenize the text column
word_tokens = [____(review) for review in tweets.text]
print('Original tokens: ', word_tokens[0])

# Filter out non-letter characters
cleaned_tokens = [[word for word in item if ____.____] for item in word_tokens]
print('Cleaned tokens: ', cleaned_tokens[0])
編輯並執行程式碼