顧客レビューからの語彙の構築
あなたは消費者向け電子機器メーカー TechZone のプロダクトアナリティクスチームの一員です。新しいガジェットについて、少量の顧客レビューが届きました。これらを分析するために、まずテキストを前処理し、各レビューを数値データで表現する際の特徴を定義する、一意の単語リストである語彙(ボキャブラリ)を作成します。
preprocess() 関数はあらかじめ用意されています。テキストを小文字化し、トークン化し、句読点を除去します。
この演習はコースの一部です
Pythonで学ぶ自然言語処理(NLP)
演習の手順
preprocess()関数を使って、データセット内の各レビューを前処理します。- 前処理済みレビューに対して
vectorizerをフィットさせます。 - 得られた語彙を出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
reviews = [
"The product is fantastic! It works like a charm.",
"I hated the product. It broke after one use.",
"Product was okay, not the best, but fine overall."
]
# Preprocess the reviews
cleaned_reviews = [____ for ____ in ____]
vectorizer = CountVectorizer()
# Fit the vectorizer
vectorizer.____
# Print the vocabulary
print(vectorizer.____)