Bắt đầu ngayBắt đầu miễn phí

Xử lý các hạng mục ít gặp

Một số đặc trưng có thể có rất nhiều hạng mục nhưng phân bố tần suất xuất hiện lại rất lệch. Ví dụ như các ngôn ngữ ưa thích để lập trình trong lĩnh vực Data Science: phổ biến có Python, R và Julia, nhưng cũng có người chọn các ngôn ngữ riêng như FORTRAN, C, v.v. Trong những trường hợp này, bạn có thể không muốn tạo một đặc trưng cho từng giá trị, mà chỉ cho các giá trị xuất hiện phổ biến hơn.

Bài tập này là một phần của khóa học

Feature Engineering cho Machine Learning bằng Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create a series out of the Country column
countries = so_survey_df.____

# Get the counts of each category
country_counts = countries.____

# Print the count values for each category
print(country_counts)
Chỉnh sửa và Chạy Mã