詞幹提取(Stemming)
你已經清理了 review 文字並移除了停用詞與標點符號,現在可以用詞幹提取把剩下的單字正規化為詞根形式。這有助於把相似單字歸在一起,讓分析更一致也更有效率。
這裡已提供 PorterStemmer 類別,以及 clean_tokens 清單。
本練習屬於課程
Python 的 Natural Language Processing(NLP)
練習說明
- 初始化
PorterStemmer()。 - 使用串列推導式(list comprehension)對
clean_tokens清單中的每個權杖進行詞幹提取。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
clean_tokens = ['flying', 'lot', 'lately', 'flights', 'keep', 'getting', 'delayed', 'honestly', 'traveling', 'work', 'gets', 'exhausting', 'endless', 'delays', 'every', 'travel', 'teaches', 'something', 'new']
# Create stemmer
stemmer = ____()
# Stem each token
stemmed_tokens = [____.____(____) for ____ in clean_tokens]
print(stemmed_tokens)