Gộp bậc (levels)
Nếu bạn thấy khó làm việc với độ lệch mạnh của exclaim_mess, thì số lượng ảnh đính kèm trong mỗi email (image) còn thách thức hơn nữa. Chạy đoạn mã sau ở console để hình dung phân phối của biến này:
table(email$image)
Hãy nhớ rằng lệnh này đếm số trường hợp trong mỗi nhóm (ví dụ có 3811 email với 0 ảnh). Vì số đếm ở các mức ảnh cao rất thấp, hãy gộp image thành một biến phân loại cho biết email có ít nhất một ảnh hay không. Trong bài tập này, bạn sẽ tạo biến mới này và khám phá mối liên hệ của nó với spam.
Bài tập này là một phần của khóa học
Phân tích Khám phá Dữ liệu với R
Hướng dẫn bài tập
Bắt đầu với email, tạo một chuỗi thao tác liên tục nối các bước sau:
- Tạo biến mới tên
has_imagecó giá trịTRUEkhi số lượng ảnh lớn hơn 0 vàFALSEnếu không. - Tạo một biểu đồ phù hợp với
emailđể trực quan hóa mối quan hệ giữahas_imagevàspam.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create plot of proportion of spam by image
email %>%
mutate(has_image = ___) %>%
ggplot(aes(x = ___, fill = ___)) +
geom_bar(position = ___)