同じデータでのTfidfとBOW
この演習では、Amazon製品の reviews の review 列を、bag-of-words と tfidf の両方で変換します。
両方のベクトライザを作成し、特徴量の最大数のみを 100 に指定してください。変換後にそれぞれ DataFrame を作成し、各データの先頭5行を表示します。
語彙の最大特徴量数の指定には注意してください。語彙が大きすぎると、セッションが切断されることがあります。
この演習はコースの一部です
Pythonで学ぶSentiment Analysis
演習の手順
- BOW と Tfidf のベクトライザをインポートします。
review列から BOW と Tfidf のベクトライザを作成して学習し、作成される特徴量数を100に制限します。- 変換後のベクトル表現から DataFrame を作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the required packages
____
# Build a BOW and tfidf vectorizers from the review column and with max of 100 features
vect1 = ____(____=100).____(____.____)
vect2 = ____(____=100).____(____.____)
# Transform the vectorizers
X1 = vect1.transform(reviews.review)
X2 = vect2.transform(reviews.review)
# Create DataFrames from the vectorizers
X_df1 = pd.DataFrame(X1.____, columns=____.____)
X_df2 = pd.DataFrame(X2.____, columns=____.____)
print('Top 5 rows using BOW: \n', X_df1.head())
print('Top 5 rows using tfidf: \n', X_df2.head())