始める無料で始める

顧客レビューからの語彙の構築

あなたは消費者向け電子機器メーカー TechZone のプロダクトアナリティクスチームの一員です。新しいガジェットについて、少量の顧客レビューが届きました。これらを分析するために、まずテキストを前処理し、各レビューを数値データで表現する際の特徴を定義する、一意の単語リストである語彙(ボキャブラリ)を作成します。

preprocess() 関数はあらかじめ用意されています。テキストを小文字化し、トークン化し、句読点を除去します。

この演習はコースの一部です

Pythonで学ぶ自然言語処理(NLP)

コースを見る

演習の手順

  • preprocess() 関数を使って、データセット内の各レビューを前処理します。
  • 前処理済みレビューに対して vectorizer をフィットさせます。
  • 得られた語彙を出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

reviews = [
    "The product is fantastic! It works like a charm.",
    "I hated the product. It broke after one use.",
    "Product was okay, not the best, but fine overall."
]
# Preprocess the reviews
cleaned_reviews = [____ for ____ in ____]

vectorizer = CountVectorizer()
# Fit the vectorizer
vectorizer.____
# Print the vocabulary 
print(vectorizer.____)
コードを編集して実行