始める無料で始める

映画レビューのBoWベクトル

この演習では、映画レビューからなる2つの pandas Series、X_trainX_test が与えられています。前者は学習用、後者はテスト用のレビューです。レビューを前処理し、CountVectorizer を使ってこれら2つの集合の BoW ベクトルを作成してください。

BoW ベクトル行列 X_train_bowX_test_bow を作成できれば、Machine Learning モデルを適用して感情分析を行う準備が整います。

この演習はコースの一部です

Pythonで学ぶNLPの特徴量エンジニアリング

コースを見る

演習の手順

  • sklearn ライブラリから CountVectorizer をインポートします。
  • すべての単語を小文字に変換し、english のストップワードを除去するように設定して、vectorizer という名前の CountVectorizer オブジェクトを作成します。
  • X_train を用いて vectorizer を学習し、その後に変換して、BoW ベクトル集合 X_train_bow を作成します。
  • vectorizer を使って X_test を変換し、BoW ベクトル集合 X_test_bow を作成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)

# Fit and transform X_train
X_train_bow = vectorizer.____(____)

# Transform X_test
X_test_bow = vectorizer.____(____)

# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)
コードを編集して実行