Podział wartości na przedziały
W przypadku wielu wartości ciągłych rzadko zależy nam na dokładnej wartości kolumny numerycznej – ważniejsze jest to, do którego przedziału dana wartość należy. Takie podejście przydaje się podczas wizualizacji danych lub upraszczania modeli uczenia maszynowego. Stosuje się je głównie dla zmiennych ciągłych, gdzie precyzja nie jest kluczowa – na przykład wiek, wzrost czy wynagrodzenie.
Przedziały tworzy się za pomocą pd.cut(df['column_name'], bins), gdzie bins może być liczbą całkowitą określającą liczbę równych przedziałów lub listą granic przedziałów.
To ćwiczenie jest częścią kursu
Inżynieria cech w uczeniu maszynowym w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Bin the continuous variable ConvertedSalary into 5 bins
so_survey_df['equal_binned'] = ____(so_survey_df['ConvertedSalary'], ____)
# Print the first 5 rows of the equal_binned column
print(so_survey_df[['equal_binned', 'ConvertedSalary']].head())