始める無料で始める

同じデータでのTfidfとBOW

この演習では、Amazon製品の reviewsreview 列を、bag-of-words と tfidf の両方で変換します。

両方のベクトライザを作成し、特徴量の最大数のみを 100 に指定してください。変換後にそれぞれ DataFrame を作成し、各データの先頭5行を表示します。

語彙の最大特徴量数の指定には注意してください。語彙が大きすぎると、セッションが切断されることがあります。

この演習はコースの一部です

Pythonで学ぶSentiment Analysis

コースを見る

演習の手順

  • BOW と Tfidf のベクトライザをインポートします。
  • review 列から BOW と Tfidf のベクトライザを作成して学習し、作成される特徴量数を100に制限します。
  • 変換後のベクトル表現から DataFrame を作成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import the required packages
____

# Build a BOW and tfidf vectorizers from the review column and with max of 100 features
vect1 = ____(____=100).____(____.____)
vect2 = ____(____=100).____(____.____) 

# Transform the vectorizers
X1 = vect1.transform(reviews.review)
X2 = vect2.transform(reviews.review)
# Create DataFrames from the vectorizers 
X_df1 = pd.DataFrame(X1.____, columns=____.____)
X_df2 = pd.DataFrame(X2.____, columns=____.____)
print('Top 5 rows using BOW: \n', X_df1.head())
print('Top 5 rows using tfidf: \n', X_df2.head())
コードを編集して実行