始める無料で始める

n-gram と語彙サイズを指定した BOW

この演習では、Amazon の商品レビューである reviews データセットを使って、もう一度 bag-of-words を作成します。主なタスクは、語彙のサイズを制限し、トークン列の長さ(n-gram)を指定することです。

この演習はコースの一部です

Pythonで学ぶSentiment Analysis

コースを見る

演習の手順

  • sklearn からベクトライザをインポートします。
  • ベクトライザを作成し、次のパラメータを指定してください:語彙サイズは 1000 に制限、バイグラムのみを含め、500 件を超えるドキュメントに出現する語は無視します。
  • ベクトライザを review 列に fit します。
  • BOW 表現から DataFrame を作成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

#Import the vectorizer
from sklearn.____.____ import ____

# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)

# Transform the review
X_review = vect.transform(reviews.review)

# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())
コードを編集して実行