Исправление несогласованности
Теперь, когда вы выяснили, что в столбце dest_size есть лишние пробелы, а в столбце cleanliness — несогласованность регистра, воспользуйтесь новыми инструментами, чтобы исправить некорректные значения в sfo_survey, не удаляя их. Удаление данных могло бы внести смещение в набор данных, если бы пришлось исключить более 5% наблюдений.
Пакеты dplyr и stringr загружены, набор данных sfo_survey доступен.
Это упражнение является частью курса
Очистка данных в R
Инструкции к упражнению
- Добавьте в
sfo_surveyстолбецdest_size_trimmed, содержащий значения из столбцаdest_sizeс удалёнными пробелами в начале и в конце строки. - Добавьте ещё один столбец
cleanliness_lower, содержащий значения из столбцаcleanliness, преобразованные в нижний регистр. - Подсчитайте количество вхождений каждой категории в столбце
dest_size_trimmed. - Подсчитайте количество вхождений каждой категории в столбце
cleanliness_lower.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Add new columns to sfo_survey
sfo_survey <- sfo_survey %>%
# dest_size_trimmed: dest_size without whitespace
mutate(dest_size_trimmed = ___,
# cleanliness_lower: cleanliness converted to lowercase
cleanliness_lower = ___)
# Count values of dest_size_trimmed
sfo_survey %>%
___
# Count values of cleanliness_lower
sfo_survey %>%
___