НачатьНачать бесплатно

Разбивка значений на интервалы

При работе со многими непрерывными значениями важен не точный показатель числового столбца, а диапазон, в который он попадает. Это удобно при визуализации данных или упрощении моделей машинного обучения. Чаще всего такой подход применяется к непрерывным переменным, где высокая точность не критична, — например, возраст, рост или заработная плата.

Интервалы создаются с помощью pd.cut(df['column_name'], bins), где bins — либо целое число, задающее количество равномерно распределённых интервалов, либо список граничных значений.

Это упражнение является частью курса

Конструирование признаков для машинного обучения в Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Bin the continuous variable ConvertedSalary into 5 bins
so_survey_df['equal_binned'] = ____(so_survey_df['ConvertedSalary'], ____)

# Print the first 5 rows of the equal_binned column
print(so_survey_df[['equal_binned', 'ConvertedSalary']].head())
Редактировать и запускать код