n-gram と語彙サイズを指定した BOW
この演習では、Amazon の商品レビューである reviews データセットを使って、もう一度 bag-of-words を作成します。主なタスクは、語彙のサイズを制限し、トークン列の長さ(n-gram)を指定することです。
この演習はコースの一部です
Pythonで学ぶSentiment Analysis
演習の手順
sklearnからベクトライザをインポートします。- ベクトライザを作成し、次のパラメータを指定してください:語彙サイズは 1000 に制限、バイグラムのみを含め、500 件を超えるドキュメントに出現する語は無視します。
- ベクトライザを
review列に fit します。 - BOW 表現から DataFrame を作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
#Import the vectorizer
from sklearn.____.____ import ____
# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)
# Transform the review
X_review = vect.transform(reviews.review)
# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())