Bắt đầu ngayBắt đầu miễn phí

Gộp biến theo tỷ lệ

Nhiều khi bạn sẽ không có sẵn các mức (level) cụ thể để đổi thành "khác" hoặc gộp lại với nhau. Thay vào đó, bạn muốn giữ các mức phổ biến nhất và đưa mọi thứ còn lại vào "other." Đặc biệt khi có rất nhiều mức và đa số là hiếm, cách này giúp việc hiển thị dữ liệu rõ ràng hơn. Hãy thử áp dụng với câu hỏi trong khảo sát Kaggle về việc mọi người muốn thử phương pháp machine learning nào trong năm tới. multiple_choice_responses đã được nạp sẵn cho bạn. Khi đếm, hãy nhớ rằng sort = TRUE mặc định sắp xếp theo thứ tự giảm dần.

Bài tập này là một phần của khóa học

Dữ liệu phân loại trong Tidyverse

Xem khóa học

Hướng dẫn bài tập

  • Loại những người không chọn phương pháp nào.
  • Tạo biến mới ml_method từ MLMethodNextYearSelect để giữ lại các tên có ít nhất 5% số người trả lời và gộp phần còn lại thành "Other" (giá trị mặc định).
  • Cuối cùng, đếm biến mới của bạn, sắp xếp theo thứ tự giảm dần.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

multiple_choice_responses %>%
  # Remove NAs of MLMethodNextYearSelect
  filter(___) %>%
  # Create ml_method, which lumps all those with less than 5% of people into "Other"
  mutate(ml_method = ___(MLMethodNextYearSelect, ___)) %>%
  # Count the frequency of your new variable, sorted in descending order
  ___(___, ___)
Chỉnh sửa và Chạy Mã