映画レビューのBoWベクトル
この演習では、映画レビューからなる2つの pandas Series、X_train と X_test が与えられています。前者は学習用、後者はテスト用のレビューです。レビューを前処理し、CountVectorizer を使ってこれら2つの集合の BoW ベクトルを作成してください。
BoW ベクトル行列 X_train_bow と X_test_bow を作成できれば、Machine Learning モデルを適用して感情分析を行う準備が整います。
この演習はコースの一部です
Pythonで学ぶNLPの特徴量エンジニアリング
演習の手順
sklearnライブラリからCountVectorizerをインポートします。- すべての単語を小文字に変換し、
englishのストップワードを除去するように設定して、vectorizerという名前のCountVectorizerオブジェクトを作成します。 X_trainを用いてvectorizerを学習し、その後に変換して、BoW ベクトル集合X_train_bowを作成します。vectorizerを使ってX_testを変換し、BoW ベクトル集合X_test_bowを作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)
# Fit and transform X_train
X_train_bow = vectorizer.____(____)
# Transform X_test
X_test_bow = vectorizer.____(____)
# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)