始める無料で始める

ストップワードの除去

次の演習では、トピックモデルでデータを使えるようにするため、Enron のメールをクレンジングします。テキストのクレンジングは難しい場合がありますが、うまく進めるための手順を学びます。メールを含むデータフレーム df が用意されています。最初のステップとして、次の演習でテキストから削除するストップワードと句読記号(記号類)のリストを定義します。さっそくやってみましょう。

この演習はコースの一部です

Pythonで学ぶ不正検知

コースを見る

演習の手順

  • ntlk から stopwords をインポートします。
  • 変数 stop にストップワードとして使う 'english' の単語を定義します。
  • string パッケージから句読記号の集合を取得し、exclude に割り当てます。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import nltk packages and string 
from nltk.corpus import ____
import string

# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))

# Define punctuations to exclude and lemmatizer
exclude = set(____.____)
コードを編集して実行