始める無料で始める

特徴インデックスを特徴名にマッピングする

レッスン動画で、CountVectorizer は語彙を必ずしもアルファベット順にインデックスしないことを確認しました。この演習では、各特徴インデックスを語彙中の対応する特徴名にマッピングする方法を学びます。

動画と同じ、ライオンに関する3つの文を使います。これらの文は corpus というリストに入っており、すでにコンソールに出力されています。

この演習はコースの一部です

Pythonで学ぶNLPの特徴量エンジニアリング

コースを見る

演習の手順

  • CountVectorizer オブジェクトを作成し、vectorizer という名前を付けてください。
  • fit_transform() を使って、corpus から bow_matrix を生成してください。
  • get_feature_names() メソッドを使って、列名を語彙中の対応する単語にマッピングしてください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create CountVectorizer object
vectorizer = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())

# Map the column names to vocabulary 
bow_df.columns = vectorizer.____

# Print bow_df
print(bow_df)
コードを編集して実行