BOW でトークン列の長さを指定する
動画で見たように、n-gram と呼ばれるトークンの長さを変えることで、文脈をより的確に捉えられる場合があります。これはとても重要です。
この演習では、Amazon の商品レビューのサンプルを扱います。review 列を使って BOW の語彙を作成し、トークン列の長さを指定してください。
この演習はコースの一部です
Pythonで学ぶSentiment Analysis
演習の手順
- ベクトライザを作成し、トークン列の長さがユニグラムとバイグラムになるように指定します。
- ベクトライザを fit します。
- fit 済みベクトライザで transform します。
- DataFrame では、列名を正しく指定してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())