Усунення неузгодженостей
Тепер, коли ви виявили, що в dest_size є проблеми з пропусками (whitespace), а в cleanliness — з регістром, скористайтеся новими інструментами, щоб виправити неузгоджені значення в sfo_survey замість повного видалення точок даних. Видалення понад 5% записів могло б спричинити упередженість у вашому наборі даних.
dplyr і stringr завантажено, sfo_survey доступний.
Ця вправа є частиною курсу
Очищення даних в R
Інструкції до вправи
- Додайте до
sfo_surveyстовпецьdest_size_trimmed, що містить значення зі стовпцяdest_sizeз вилученими початковими та кінцевими пропусками. - Додайте ще один стовпець
cleanliness_lower, що містить значення зі стовпцяcleanliness, перетворені на нижній регістр. - Порахуйте кількість появ кожної категорії у
dest_size_trimmed. - Порахуйте кількість появ кожної категорії у
cleanliness_lower.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Add new columns to sfo_survey
sfo_survey <- sfo_survey %>%
# dest_size_trimmed: dest_size without whitespace
mutate(dest_size_trimmed = ___,
# cleanliness_lower: cleanliness converted to lowercase
cleanliness_lower = ___)
# Count values of dest_size_trimmed
sfo_survey %>%
___
# Count values of cleanliness_lower
sfo_survey %>%
___