纠正不一致性
既然您已经发现 dest_size 存在空白不一致、cleanliness 存在大小写不一致,接下来请使用新学到的工具来修复 sfo_survey 中这些不一致的取值,而不是直接删除数据点。如果需要删除的数据点超过 5%,这可能会给数据集带来偏差。
已加载 dplyr 和 stringr,并已提供 sfo_survey。
本练习是课程的一部分
R 中的数据清洗
练习说明
- 在
sfo_survey中新增一列dest_size_trimmed,其值为dest_size列去除所有首尾空白后的结果。 - 再新增一列
cleanliness_lower,其值为cleanliness列转换为全小写后的结果。 - 统计
dest_size_trimmed中每个类别出现的次数。 - 统计
cleanliness_lower中每个类别出现的次数。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Add new columns to sfo_survey
sfo_survey <- sfo_survey %>%
# dest_size_trimmed: dest_size without whitespace
mutate(dest_size_trimmed = ___,
# cleanliness_lower: cleanliness converted to lowercase
cleanliness_lower = ___)
# Count values of dest_size_trimmed
sfo_survey %>%
___
# Count values of cleanliness_lower
sfo_survey %>%
___