ストップワードの除去
次の演習では、トピックモデルでデータを使えるようにするため、Enron のメールをクレンジングします。テキストのクレンジングは難しい場合がありますが、うまく進めるための手順を学びます。メールを含むデータフレーム df が用意されています。最初のステップとして、次の演習でテキストから削除するストップワードと句読記号(記号類)のリストを定義します。さっそくやってみましょう。
この演習はコースの一部です
Pythonで学ぶ不正検知
演習の手順
ntlkから stopwords をインポートします。- 変数
stopにストップワードとして使う 'english' の単語を定義します。 stringパッケージから句読記号の集合を取得し、excludeに割り当てます。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import nltk packages and string
from nltk.corpus import ____
import string
# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))
# Define punctuations to exclude and lemmatizer
exclude = set(____.____)