始める無料で始める

あまり見かけないカテゴリへの対応

ある特徴量は非常に多くのカテゴリを持つ一方で、出現頻度の分布が極端に偏っていることがあります。たとえば、Data Scienceでよく使われるプログラミング言語には Python、R、Julia などの一般的な選択肢がありますが、FORTRAN や C のような個別の選好を持つ人もいます。このような場合、すべての値に対して特徴量を作るのではなく、出現頻度の高いものだけを対象にするほうがよいことがあります。

この演習はコースの一部です

Python で学ぶ Machine Learning のための特徴量エンジニアリング

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create a series out of the Country column
countries = so_survey_df.____

# Get the counts of each category
country_counts = countries.____

# Print the count values for each category
print(country_counts)
コードを編集して実行