Rozdělení hodnot do skupin
U mnoha spojitých hodnot tě nezajímá přesné číslo v daném sloupci, ale spíš to, do jaké skupiny hodnota spadá. To se hodí při vizualizaci dat nebo při zjednodušování modelů strojového učení. Nejčastěji se tento přístup používá u spojitých proměnných, kde přesnost není klíčová – například u věku, výšky nebo příjmů.
Skupiny (biny) se vytvářejí pomocí pd.cut(df['column_name'], bins), kde bins může být celé číslo určující počet stejně velkých skupin, nebo seznam hraničních hodnot.
Toto cvičení je součástí kurzu
Feature Engineering for Machine Learning in Python
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Bin the continuous variable ConvertedSalary into 5 bins
so_survey_df['equal_binned'] = ____(so_survey_df['ConvertedSalary'], ____)
# Print the first 5 rows of the equal_binned column
print(so_survey_df[['equal_binned', 'ConvertedSalary']].head())