Zacznij terazZacznij za darmo

Poprawianie niespójności

Skoro już wiesz, że kolumna dest_size zawiera niespójności z białymi znakami, a cleanliness – niespójności związane z wielkością liter, możesz teraz skorzystać z nowych narzędzi, aby naprawić te wartości w zbiorze sfo_survey zamiast całkowicie usuwać odpowiednie wiersze. Usuwanie danych mogłoby wprowadzić błąd systematyczny do zbioru, jeśli trzeba by odrzucić ponad 5% obserwacji.

Biblioteki dplyr i stringr są już wczytane, a zbiór sfo_survey jest dostępny.

To ćwiczenie jest częścią kursu

Czyszczenie danych w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Dodaj do sfo_survey kolumnę o nazwie dest_size_trimmed, która będzie zawierać wartości z kolumny dest_size z usuniętymi białymi znakami na początku i na końcu.
  • Dodaj kolejną kolumnę o nazwie cleanliness_lower, która będzie zawierać wartości z kolumny cleanliness przekonwertowane na same małe litery.
  • Zlicz liczbę wystąpień każdej kategorii w kolumnie dest_size_trimmed.
  • Zlicz liczbę wystąpień każdej kategorii w kolumnie cleanliness_lower.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Add new columns to sfo_survey
sfo_survey <- sfo_survey %>%
  # dest_size_trimmed: dest_size without whitespace
  mutate(dest_size_trimmed = ___,
         # cleanliness_lower: cleanliness converted to lowercase
         cleanliness_lower = ___)

# Count values of dest_size_trimmed
sfo_survey %>%
  ___

# Count values of cleanliness_lower
sfo_survey %>%
  ___
Edytuj i uruchom kod