НачатьНачать бесплатно

Исправление несогласованности

Теперь, когда вы выяснили, что в столбце dest_size есть лишние пробелы, а в столбце cleanliness — несогласованность регистра, воспользуйтесь новыми инструментами, чтобы исправить некорректные значения в sfo_survey, не удаляя их. Удаление данных могло бы внести смещение в набор данных, если бы пришлось исключить более 5% наблюдений.

Пакеты dplyr и stringr загружены, набор данных sfo_survey доступен.

Это упражнение является частью курса

Очистка данных в R

Посмотреть курс

Инструкции к упражнению

  • Добавьте в sfo_survey столбец dest_size_trimmed, содержащий значения из столбца dest_size с удалёнными пробелами в начале и в конце строки.
  • Добавьте ещё один столбец cleanliness_lower, содержащий значения из столбца cleanliness, преобразованные в нижний регистр.
  • Подсчитайте количество вхождений каждой категории в столбце dest_size_trimmed.
  • Подсчитайте количество вхождений каждой категории в столбце cleanliness_lower.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Add new columns to sfo_survey
sfo_survey <- sfo_survey %>%
  # dest_size_trimmed: dest_size without whitespace
  mutate(dest_size_trimmed = ___,
         # cleanliness_lower: cleanliness converted to lowercase
         cleanliness_lower = ___)

# Count values of dest_size_trimmed
sfo_survey %>%
  ___

# Count values of cleanliness_lower
sfo_survey %>%
  ___
Редактировать и запускать код