次元数の分析と前処理
この演習では、前の演習で扱った映画のタグラインを前処理した lem_corpus が用意されています。つまり、タグラインは小文字化され、レンマ化され、ストップワードが除去されています。
あなたのタスクは、これらのレンマ化済みタグラインに対して bag-of-words 表現である bow_lem_matrix を生成し、前の演習で得た bow_matrix の形状(shape)と比較することです。lem_corpus に含まれる最初の5件のレンマ化済みタグラインは、確認のためにコンソールに出力済みです。
この演習はコースの一部です
Pythonで学ぶNLPの特徴量エンジニアリング
演習の手順
sklearnからCountVectorizerクラスをインポートします。CountVectorizerオブジェクトを作成し、vectorizerという名前を付けます。fit_transform()を使って、lem_corpusからbow_lem_matrixを生成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)
# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)