Loại bỏ mức (levels)
Bảng chéo từ bài trước cho thấy có một số mức có tần suất rất thấp. Để đơn giản hóa việc phân tích, thường nên loại bỏ các mức như vậy.
Trong R, việc này cần hai bước: đầu tiên lọc bỏ mọi hàng có các mức có tần suất rất thấp, sau đó loại bỏ các mức này khỏi biến factor bằng droplevels(). Lý do là hàm droplevels() sẽ giữ các mức chỉ có 1 hoặc 2 quan sát; nó chỉ loại các mức không còn tồn tại trong tập dữ liệu.
Bài tập này là một phần của khóa học
Phân tích Khám phá Dữ liệu với R
Hướng dẫn bài tập
Bảng chéo từ bài trước có sẵn trong workspace của bạn dưới tên tab.
- Nạp gói
dplyr. - In
tabđể tìm xem mức nào củaaligncó tổng số mục ít nhất. - Dùng
filter()để lọc bỏ tất cả các hàng củacomicscó mức đó, rồi loại bỏ mức không dùng bằngdroplevels(). Lưu tập dữ liệu đã đơn giản hóa với têncomics_filtered.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load dplyr
___
# Print tab
___
# Remove align level
comics_filtered <- ___ %>%
___(align != ___) %>%
___()
# See the result
comics_filtered