最もよく出現する単語を見つける
特徴量を作成したら、期待どおりになっているかを確認するために中身を点検するのが常におすすめです。これにより、早い段階でエラーに気づけますし、その後に必要な追加の特徴量エンジニアリングを見直すきっかけにもなります。
前の演習で学習したベクトライザ(cv)と、単語出現回数からなるスパース配列(cv_trigram)はワークスペースに用意されています。
この演習はコースの一部です
Python で学ぶ Machine Learning のための特徴量エンジニアリング
演習の手順
- 特徴量(単語出現回数)の DataFrame を作成します。
- 単語の出現回数を集計し、最も頻出する単語の上位5件を表示します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create a DataFrame of the features
cv_tri_df = ____(____,
columns=cv_trigram_vec.get_feature_names()).add_prefix('Counts_')
# Print the top 5 words in the sorted output
print(cv_tri_df.sum().____(ascending=____).head())