Робота з рідкісними категоріями
Деякі ознаки можуть мати багато різних категорій, але з дуже нерівномірним розподілом частот. Наприклад, у Data Science популярні мови програмування — це Python, R і Julia, але трапляються й індивідуальні вибори, як-от FORTRAN, C тощо. У таких випадках не завжди варто створювати окрему ознаку для кожного значення — зазвичай достатньо залишити лише найпоширеніші.
Ця вправа є частиною курсу
Feature Engineering для машинного навчання в Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create a series out of the Country column
countries = so_survey_df.____
# Get the counts of each category
country_counts = countries.____
# Print the count values for each category
print(country_counts)