按比例合并变量水平
很多时候,您并没有特定的水平要改名或合并。相反,您希望保留最常见的水平,把其余都放到 "other"。当水平很多且大多数都很少见时,这种做法有助于展示数据。让我们用 Kaggle 问卷里关于受访者明年想尝试的机器学习方法这个问题来练习。multiple_choice_responses 已为您加载。计数时请记住,sort = TRUE 默认对应降序。
本练习是课程的一部分
Tidyverse 中的分类数据
练习说明
- 去除没有选择任何方法的受访者。
- 基于
MLMethodNextYearSelect创建新变量ml_method:保留至少有 5% 受访者选择的标题,其余合并为默认值 "Other"。 - 最后,对新变量计数,并按降序排序。
交互式实操练习
通过完成这段示例代码来试试这个练习。
multiple_choice_responses %>%
# Remove NAs of MLMethodNextYearSelect
filter(___) %>%
# Create ml_method, which lumps all those with less than 5% of people into "Other"
mutate(ml_method = ___(MLMethodNextYearSelect, ___)) %>%
# Count the frequency of your new variable, sorted in descending order
___(___, ___)