始める無料で始める

次元数の分析と前処理

この演習では、前の演習で扱った映画のタグラインを前処理した lem_corpus が用意されています。つまり、タグラインは小文字化され、レンマ化され、ストップワードが除去されています。

あなたのタスクは、これらのレンマ化済みタグラインに対して bag-of-words 表現である bow_lem_matrix を生成し、前の演習で得た bow_matrix の形状(shape)と比較することです。lem_corpus に含まれる最初の5件のレンマ化済みタグラインは、確認のためにコンソールに出力済みです。

この演習はコースの一部です

Pythonで学ぶNLPの特徴量エンジニアリング

コースを見る

演習の手順

  • sklearn から CountVectorizer クラスをインポートします。
  • CountVectorizer オブジェクトを作成し、vectorizer という名前を付けます。
  • fit_transform() を使って、lem_corpus から bow_lem_matrix を生成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)

# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)
コードを編集して実行