Gestionarea categoriilor rare
Unele caracteristici pot avea multe categorii diferite, dar cu o distribuție foarte inegală a aparițiilor lor. Ia ca exemplu limbajele de programare preferate în Data Science: alegeri comune sunt Python, R și Julia, însă există și persoane cu preferințe mai neobișnuite, cum ar fi FORTRAN, C etc. În astfel de cazuri, poate că nu vrei să creezi o caracteristică pentru fiecare valoare, ci doar pentru cele mai frecvente.
Acest exercițiu face parte din cursul
Ingineria caracteristicilor pentru Machine Learning în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create a series out of the Country column
countries = so_survey_df.____
# Get the counts of each category
country_counts = countries.____
# Print the count values for each category
print(country_counts)