Obsługa rzadkich kategorii
Niektóre cechy mogą mieć wiele różnych kategorii, ale ich rozkład bywa bardzo nierównomierny. Weźmy na przykład ulubione języki programowania w świecie Data Science – popularne wybory to Python, R i Julia, ale zdarzają się też bardziej niszowe, jak FORTRAN czy C. W takich przypadkach tworzenie osobnej cechy dla każdej wartości może nie mieć sensu – lepiej skupić się tylko na tych najczęściej występujących.
To ćwiczenie jest częścią kursu
Inżynieria cech w uczeniu maszynowym w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create a series out of the Country column
countries = so_survey_df.____
# Get the counts of each category
country_counts = countries.____
# Print the count values for each category
print(country_counts)