始める無料で始める

製品フィードバックのTF-IDF表現

あなたはスマートホーム企業のカスタマーサポートチームと一緒に働いています。さまざまなスマートデバイスに関するユーザーフィードバックが収集され、各レビューでどの単語が際立っているのかを知りたいと考えています。あなたは、複数のフィードバック間で最も関連性の高い用語を強調表示するために TF-IDF 手法を提案しました。さっそく手伝っていきましょう!

テキストを受け取り、前処理済みテキストを返す preprocess() 関数があらかじめ用意されています。この関数は小文字化、トークン化、句読点の除去を行います。Pandas は pd としてインポート済みで、TfidfVectorizer クラスも使用可能です。

この演習はコースの一部です

Pythonで学ぶ自然言語処理(NLP)

コースを見る

演習の手順

  • TF-IDF の vectorizer を初期化します。
  • クリーニング済みレビューを tfidf_matrix に変換します。
  • 語彙の単語を列にもつ tfidf_matrix の DataFrame df を作成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

reviews = ["The smart speaker is incredible. Clear sound and fast responses!",
           "I am disappointed with the smart bulb. It stopped working in a week.",
           "The thermostat is okay. Not too smart, but functional."]
cleaned_reviews = [preprocess(review) for review in reviews]

# Initialize the vectorizer
vectorizer = ____
# Transform the cleaned reviews
tfidf_matrix = ____
# Create a DataFrame for TF-IDF
df = pd.DataFrame(
  tfidf_matrix.toarray(),
  columns=vectorizer.____
)
print(df.head())
コードを編集して実行