開始使用免費開始

詞幹提取(Stemming)

你已經清理了 review 文字並移除了停用詞與標點符號,現在可以用詞幹提取把剩下的單字正規化為詞根形式。這有助於把相似單字歸在一起,讓分析更一致也更有效率。

這裡已提供 PorterStemmer 類別,以及 clean_tokens 清單。

本練習屬於課程

Python 的 Natural Language Processing(NLP)

檢視課程

練習說明

  • 初始化 PorterStemmer()
  • 使用串列推導式(list comprehension)對 clean_tokens 清單中的每個權杖進行詞幹提取。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

clean_tokens = ['flying', 'lot', 'lately', 'flights', 'keep', 'getting', 'delayed', 'honestly', 'traveling', 'work', 'gets', 'exhausting', 'endless', 'delays', 'every', 'travel', 'teaches', 'something', 'new']

# Create stemmer
stemmer = ____()

# Stem each token
stemmed_tokens = [____.____(____) for ____ in clean_tokens]

print(stemmed_tokens)
編輯並執行程式碼