Zacznij terazZacznij za darmo

Obsługa rzadkich kategorii

Niektóre cechy mogą mieć wiele różnych kategorii, ale ich rozkład bywa bardzo nierównomierny. Weźmy na przykład ulubione języki programowania w świecie Data Science – popularne wybory to Python, R i Julia, ale zdarzają się też bardziej niszowe, jak FORTRAN czy C. W takich przypadkach tworzenie osobnej cechy dla każdej wartości może nie mieć sensu – lepiej skupić się tylko na tych najczęściej występujących.

To ćwiczenie jest częścią kursu

Inżynieria cech w uczeniu maszynowym w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create a series out of the Country column
countries = so_survey_df.____

# Get the counts of each category
country_counts = countries.____

# Print the count values for each category
print(country_counts)
Edytuj i uruchom kod