ストップワードの除去
あなたは、ユーザーからのフィードバックを「製品の問題」「サービスの問題」「提案」などのカテゴリに分類するプロジェクトに取り組んでいます。多くの場合、ストップワードはカテゴリの違いを見分けるうえで意味を持たないことが多いです。そこで、これらのストップワードを取り除き、後で Machine Learning が正しいトピックにフィードバックを分類しやすくなるよう、重要な単語に焦点を当てましょう。
nltk.tokenize の word_tokenize と、nltk.corpus の stopwords.words はすでにインポートされています。さらに、NLTK リソースの punkt_tab と stopwords もダウンロード済みです。
この演習はコースの一部です
Pythonで学ぶ自然言語処理(NLP)
演習の手順
- 提供されたフィードバックを単語にトークン化します。
- 英語のストップワード一覧を取得します。
- 英語のストップワードを除去し、結果を
filtered_tokensに保存します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
feedback = "I reached out to support and got a helpful response within minutes!!! Very #impressed"
# Tokenize the text
tokens = word_tokenize(____)
# Get the list of English stop words
stop_words = stopwords.____('____')
# Remove stop words
filtered_tokens = [____ for word in tokens if ____.lower() not in ____]
print(filtered_tokens)