ÎncepețiÎncepe gratuit

Gestionarea categoriilor rare

Unele caracteristici pot avea multe categorii diferite, dar cu o distribuție foarte inegală a aparițiilor lor. Ia ca exemplu limbajele de programare preferate în Data Science: alegeri comune sunt Python, R și Julia, însă există și persoane cu preferințe mai neobișnuite, cum ar fi FORTRAN, C etc. În astfel de cazuri, poate că nu vrei să creezi o caracteristică pentru fiecare valoare, ci doar pentru cele mai frecvente.

Acest exercițiu face parte din cursul

Ingineria caracteristicilor pentru Machine Learning în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create a series out of the Country column
countries = so_survey_df.____

# Get the counts of each category
country_counts = countries.____

# Print the count values for each category
print(country_counts)
Editează și rulează codul