始める無料で始める

映画のタグラインでBoWモデルを作る

この演習では、7000以上の映画のタグラインからなる corpus が用意されています。あなたの仕事は、これらのタグラインのbag-of-words表現である bow_matrix を作成することです。この演習では、テキストの前処理は行わず、直接 bow_matrix を生成します。

あわせて、生成された bow_matrix の形状も確認します。corpus の最初の5件のタグラインは、確認用にコンソールへ出力済みです。

この演習はコースの一部です

Pythonで学ぶNLPの特徴量エンジニアリング

コースを見る

演習の手順

  • sklearn から CountVectorizer クラスをインポートします。
  • CountVectorizer オブジェクトを作成し、名前を vectorizer とします。
  • fit_transform() を使って、corpus から bow_matrix を生成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Print the shape of bow_matrix
print(bow_matrix.shape)
コードを編集して実行