ПочатиПочніть безкоштовно

Усунення неузгодженостей

Тепер, коли ви виявили, що в dest_size є проблеми з пропусками (whitespace), а в cleanliness — з регістром, скористайтеся новими інструментами, щоб виправити неузгоджені значення в sfo_survey замість повного видалення точок даних. Видалення понад 5% записів могло б спричинити упередженість у вашому наборі даних.

dplyr і stringr завантажено, sfo_survey доступний.

Ця вправа є частиною курсу

Очищення даних в R

Переглянути курс

Інструкції до вправи

  • Додайте до sfo_survey стовпець dest_size_trimmed, що містить значення зі стовпця dest_size з вилученими початковими та кінцевими пропусками.
  • Додайте ще один стовпець cleanliness_lower, що містить значення зі стовпця cleanliness, перетворені на нижній регістр.
  • Порахуйте кількість появ кожної категорії у dest_size_trimmed.
  • Порахуйте кількість появ кожної категорії у cleanliness_lower.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Add new columns to sfo_survey
sfo_survey <- sfo_survey %>%
  # dest_size_trimmed: dest_size without whitespace
  mutate(dest_size_trimmed = ___,
         # cleanliness_lower: cleanliness converted to lowercase
         cleanliness_lower = ___)

# Count values of dest_size_trimmed
sfo_survey %>%
  ___

# Count values of cleanliness_lower
sfo_survey %>%
  ___
Редагувати та запускати код