ステミング
review テキストをクリーニングし、ストップワードと句読点を除去できました。次は、残った単語をステミングで正規化し、語を語幹に還元します。これにより、似た単語をまとめられ、分析がより一貫して効率的になります。
PorterStemmer クラスと、clean_tokens のリストが用意されています。
この演習はコースの一部です
Pythonで学ぶ自然言語処理(NLP)
演習の手順
PorterStemmer()を初期化します。- リスト内包表記を使って、
clean_tokensリスト内の各トークンをステミングします。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
clean_tokens = ['flying', 'lot', 'lately', 'flights', 'keep', 'getting', 'delayed', 'honestly', 'traveling', 'work', 'gets', 'exhausting', 'endless', 'delays', 'every', 'travel', 'teaches', 'something', 'new']
# Create stemmer
stemmer = ____()
# Stem each token
stemmed_tokens = [____.____(____) for ____ in clean_tokens]
print(stemmed_tokens)