Работа с редкими категориями
Некоторые признаки могут содержать множество различных категорий, которые встречаются с очень разной частотой. Возьмём, например, любимые языки программирования специалистов по Data Science: среди популярных вариантов — Python, R и Julia, но некоторые разработчики выбирают экзотические языки, например FORTRAN или C. В таких случаях нет смысла создавать отдельный признак для каждого значения — лучше сосредоточиться только на наиболее распространённых.
Это упражнение является частью курса
Конструирование признаков для машинного обучения в Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create a series out of the Country column
countries = so_survey_df.____
# Get the counts of each category
country_counts = countries.____
# Print the count values for each category
print(country_counts)