始める無料で始める

ステミング

review テキストをクリーニングし、ストップワードと句読点を除去できました。次は、残った単語をステミングで正規化し、語を語幹に還元します。これにより、似た単語をまとめられ、分析がより一貫して効率的になります。

PorterStemmer クラスと、clean_tokens のリストが用意されています。

この演習はコースの一部です

Pythonで学ぶ自然言語処理(NLP)

コースを見る

演習の手順

  • PorterStemmer() を初期化します。
  • リスト内包表記を使って、clean_tokens リスト内の各トークンをステミングします。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

clean_tokens = ['flying', 'lot', 'lately', 'flights', 'keep', 'getting', 'delayed', 'honestly', 'traveling', 'work', 'gets', 'exhausting', 'endless', 'delays', 'every', 'travel', 'teaches', 'something', 'new']

# Create stemmer
stemmer = ____()

# Stem each token
stemmed_tokens = [____.____(____) for ____ in clean_tokens]

print(stemmed_tokens)
コードを編集して実行