特徴インデックスを特徴名にマッピングする
レッスン動画で、CountVectorizer は語彙を必ずしもアルファベット順にインデックスしないことを確認しました。この演習では、各特徴インデックスを語彙中の対応する特徴名にマッピングする方法を学びます。
動画と同じ、ライオンに関する3つの文を使います。これらの文は corpus というリストに入っており、すでにコンソールに出力されています。
この演習はコースの一部です
Pythonで学ぶNLPの特徴量エンジニアリング
演習の手順
CountVectorizerオブジェクトを作成し、vectorizerという名前を付けてください。fit_transform()を使って、corpusからbow_matrixを生成してください。get_feature_names()メソッドを使って、列名を語彙中の対応する単語にマッピングしてください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create CountVectorizer object
vectorizer = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Convert bow_matrix into a DataFrame
bow_df = pd.DataFrame(bow_matrix.toarray())
# Map the column names to vocabulary
bow_df.columns = vectorizer.____
# Print bow_df
print(bow_df)