製品フィードバックのTF-IDF表現
あなたはスマートホーム企業のカスタマーサポートチームと一緒に働いています。さまざまなスマートデバイスに関するユーザーフィードバックが収集され、各レビューでどの単語が際立っているのかを知りたいと考えています。あなたは、複数のフィードバック間で最も関連性の高い用語を強調表示するために TF-IDF 手法を提案しました。さっそく手伝っていきましょう!
テキストを受け取り、前処理済みテキストを返す preprocess() 関数があらかじめ用意されています。この関数は小文字化、トークン化、句読点の除去を行います。Pandas は pd としてインポート済みで、TfidfVectorizer クラスも使用可能です。
この演習はコースの一部です
Pythonで学ぶ自然言語処理(NLP)
演習の手順
- TF-IDF の
vectorizerを初期化します。 - クリーニング済みレビューを
tfidf_matrixに変換します。 - 語彙の単語を列にもつ
tfidf_matrixの DataFramedfを作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
reviews = ["The smart speaker is incredible. Clear sound and fast responses!",
"I am disappointed with the smart bulb. It stopped working in a week.",
"The thermostat is okay. Not too smart, but functional."]
cleaned_reviews = [preprocess(review) for review in reviews]
# Initialize the vectorizer
vectorizer = ____
# Transform the cleaned reviews
tfidf_matrix = ____
# Create a DataFrame for TF-IDF
df = pd.DataFrame(
tfidf_matrix.toarray(),
columns=vectorizer.____
)
print(df.head())