合并类别
如果处理 exclaim_mess 的高度偏斜已经不太容易,那么每封邮件所附带图片的数量(image)会更具挑战。请在控制台运行以下代码,先了解它的分布:
table(email$image)
回顾一下,这会统计每个类别中的样本数量(例如,有 3811 封邮件包含 0 张图片)。鉴于高图片数量对应的计数非常少,我们将把 image 合并为一个分类变量,用于指示邮件是否至少包含 1 张图片。在本练习中,您将创建这个新变量,并探索它与垃圾邮件的关联。
本练习是课程的一部分
R 中的探索性数据分析
练习说明
以 email 开始,构建一个连续的管道,依次完成以下任务:
- 创建一个名为
has_image的新变量:当图片数量大于 0 时取TRUE,否则取FALSE。 - 使用
email绘制合适的图形,以可视化has_image与spam之间的关系。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create plot of proportion of spam by image
email %>%
mutate(has_image = ___) %>%
ggplot(aes(x = ___, fill = ___)) +
geom_bar(position = ___)