Gộp biến theo tỷ lệ
Nhiều khi bạn sẽ không có sẵn các mức (level) cụ thể để đổi thành "khác" hoặc gộp lại với nhau. Thay vào đó, bạn muốn giữ các mức phổ biến nhất và đưa mọi thứ còn lại vào "other." Đặc biệt khi có rất nhiều mức và đa số là hiếm, cách này giúp việc hiển thị dữ liệu rõ ràng hơn. Hãy thử áp dụng với câu hỏi trong khảo sát Kaggle về việc mọi người muốn thử phương pháp machine learning nào trong năm tới. multiple_choice_responses đã được nạp sẵn cho bạn. Khi đếm, hãy nhớ rằng sort = TRUE mặc định sắp xếp theo thứ tự giảm dần.
Bài tập này là một phần của khóa học
Dữ liệu phân loại trong Tidyverse
Hướng dẫn bài tập
- Loại những người không chọn phương pháp nào.
- Tạo biến mới
ml_methodtừMLMethodNextYearSelectđể giữ lại các tên có ít nhất 5% số người trả lời và gộp phần còn lại thành "Other" (giá trị mặc định). - Cuối cùng, đếm biến mới của bạn, sắp xếp theo thứ tự giảm dần.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
multiple_choice_responses %>%
# Remove NAs of MLMethodNextYearSelect
filter(___) %>%
# Create ml_method, which lumps all those with less than 5% of people into "Other"
mutate(ml_method = ___(MLMethodNextYearSelect, ___)) %>%
# Count the frequency of your new variable, sorted in descending order
___(___, ___)