映画のタグラインでBoWモデルを作る
この演習では、7000以上の映画のタグラインからなる corpus が用意されています。あなたの仕事は、これらのタグラインのbag-of-words表現である bow_matrix を作成することです。この演習では、テキストの前処理は行わず、直接 bow_matrix を生成します。
あわせて、生成された bow_matrix の形状も確認します。corpus の最初の5件のタグラインは、確認用にコンソールへ出力済みです。
この演習はコースの一部です
Pythonで学ぶNLPの特徴量エンジニアリング
演習の手順
sklearnからCountVectorizerクラスをインポートします。CountVectorizerオブジェクトを作成し、名前をvectorizerとします。fit_transform()を使って、corpusからbow_matrixを生成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Print the shape of bow_matrix
print(bow_matrix.shape)