开始使用免费开始使用

按比例合并变量水平

很多时候,您并没有特定的水平要改名或合并。相反,您希望保留最常见的水平,把其余都放到 "other"。当水平很多且大多数都很少见时,这种做法有助于展示数据。让我们用 Kaggle 问卷里关于受访者明年想尝试的机器学习方法这个问题来练习。multiple_choice_responses 已为您加载。计数时请记住,sort = TRUE 默认对应降序。

本练习是课程的一部分

Tidyverse 中的分类数据

查看课程

练习说明

  • 去除没有选择任何方法的受访者。
  • 基于 MLMethodNextYearSelect 创建新变量 ml_method:保留至少有 5% 受访者选择的标题,其余合并为默认值 "Other"。
  • 最后,对新变量计数,并按降序排序。

交互式实操练习

通过完成这段示例代码来试试这个练习。

multiple_choice_responses %>%
  # Remove NAs of MLMethodNextYearSelect
  filter(___) %>%
  # Create ml_method, which lumps all those with less than 5% of people into "Other"
  mutate(ml_method = ___(MLMethodNextYearSelect, ___)) %>%
  # Count the frequency of your new variable, sorted in descending order
  ___(___, ___)
编辑并运行代码