始める無料で始める

BOW でトークン列の長さを指定する

動画で見たように、n-gram と呼ばれるトークンの長さを変えることで、文脈をより的確に捉えられる場合があります。これはとても重要です。

この演習では、Amazon の商品レビューのサンプルを扱います。review 列を使って BOW の語彙を作成し、トークン列の長さを指定してください。

この演習はコースの一部です

Pythonで学ぶSentiment Analysis

コースを見る

演習の手順

  • ベクトライザを作成し、トークン列の長さがユニグラムとバイグラムになるように指定します。
  • ベクトライザを fit します。
  • fit 済みベクトライザで transform します。
  • DataFrame では、列名を正しく指定してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())
コードを編集して実行