あまり見かけないカテゴリへの対応
ある特徴量は非常に多くのカテゴリを持つ一方で、出現頻度の分布が極端に偏っていることがあります。たとえば、Data Scienceでよく使われるプログラミング言語には Python、R、Julia などの一般的な選択肢がありますが、FORTRAN や C のような個別の選好を持つ人もいます。このような場合、すべての値に対して特徴量を作るのではなく、出現頻度の高いものだけを対象にするほうがよいことがあります。
この演習はコースの一部です
Python で学ぶ Machine Learning のための特徴量エンジニアリング
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create a series out of the Country column
countries = so_survey_df.____
# Get the counts of each category
country_counts = countries.____
# Print the count values for each category
print(country_counts)