Xử lý các hạng mục ít gặp
Một số đặc trưng có thể có rất nhiều hạng mục nhưng phân bố tần suất xuất hiện lại rất lệch. Ví dụ như các ngôn ngữ ưa thích để lập trình trong lĩnh vực Data Science: phổ biến có Python, R và Julia, nhưng cũng có người chọn các ngôn ngữ riêng như FORTRAN, C, v.v. Trong những trường hợp này, bạn có thể không muốn tạo một đặc trưng cho từng giá trị, mà chỉ cho các giá trị xuất hiện phổ biến hơn.
Bài tập này là một phần của khóa học
Feature Engineering cho Machine Learning bằng Python
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a series out of the Country column
countries = so_survey_df.____
# Get the counts of each category
country_counts = countries.____
# Print the count values for each category
print(country_counts)