Poprawianie niespójności
Skoro już wiesz, że kolumna dest_size zawiera niespójności z białymi znakami, a cleanliness – niespójności związane z wielkością liter, możesz teraz skorzystać z nowych narzędzi, aby naprawić te wartości w zbiorze sfo_survey zamiast całkowicie usuwać odpowiednie wiersze. Usuwanie danych mogłoby wprowadzić błąd systematyczny do zbioru, jeśli trzeba by odrzucić ponad 5% obserwacji.
Biblioteki dplyr i stringr są już wczytane, a zbiór sfo_survey jest dostępny.
To ćwiczenie jest częścią kursu
Czyszczenie danych w R
Instrukcje do ćwiczenia
- Dodaj do
sfo_surveykolumnę o nazwiedest_size_trimmed, która będzie zawierać wartości z kolumnydest_sizez usuniętymi białymi znakami na początku i na końcu. - Dodaj kolejną kolumnę o nazwie
cleanliness_lower, która będzie zawierać wartości z kolumnycleanlinessprzekonwertowane na same małe litery. - Zlicz liczbę wystąpień każdej kategorii w kolumnie
dest_size_trimmed. - Zlicz liczbę wystąpień każdej kategorii w kolumnie
cleanliness_lower.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Add new columns to sfo_survey
sfo_survey <- sfo_survey %>%
# dest_size_trimmed: dest_size without whitespace
mutate(dest_size_trimmed = ___,
# cleanliness_lower: cleanliness converted to lowercase
cleanliness_lower = ___)
# Count values of dest_size_trimmed
sfo_survey %>%
___
# Count values of cleanliness_lower
sfo_survey %>%
___