Phân nhóm (binning) giá trị
Với nhiều giá trị liên tục, bạn thường không quá quan tâm đến con số chính xác của một cột số, mà chú ý nhiều hơn đến “nhóm” (bucket) mà nó rơi vào. Điều này hữu ích khi trực quan hóa dữ liệu hoặc đơn giản hóa mô hình Machine Learning của bạn. Cách làm này chủ yếu áp dụng cho biến liên tục khi độ chính xác tuyệt đối không phải ưu tiên lớn, ví dụ: tuổi, chiều cao, tiền lương.
Các bin được tạo bằng pd.cut(df['column_name'], bins) trong đó bins có thể là một số nguyên chỉ số lượng bin cách đều nhau, hoặc một danh sách các ranh giới bin.
Bài tập này là một phần của khóa học
Feature Engineering cho Machine Learning bằng Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Bin the continuous variable ConvertedSalary into 5 bins
so_survey_df['equal_binned'] = ____(so_survey_df['ConvertedSalary'], ____)
# Print the first 5 rows of the equal_binned column
print(so_survey_df[['equal_binned', 'ConvertedSalary']].head())