Разбивка значений на интервалы
При работе со многими непрерывными значениями важен не точный показатель числового столбца, а диапазон, в который он попадает. Это удобно при визуализации данных или упрощении моделей машинного обучения. Чаще всего такой подход применяется к непрерывным переменным, где высокая точность не критична, — например, возраст, рост или заработная плата.
Интервалы создаются с помощью pd.cut(df['column_name'], bins), где bins — либо целое число, задающее количество равномерно распределённых интервалов, либо список граничных значений.
Это упражнение является частью курса
Конструирование признаков для машинного обучения в Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Bin the continuous variable ConvertedSalary into 5 bins
so_survey_df['equal_binned'] = ____(so_survey_df['ConvertedSalary'], ____)
# Print the first 5 rows of the equal_binned column
print(so_survey_df[['equal_binned', 'ConvertedSalary']].head())