Oprava nekonzistencí
Teď, když víš, že sloupec dest_size obsahuje nekonzistentní mezery a sloupec cleanliness nekonzistentní velikost písmen, použiješ nové nástroje k opravě těchto hodnot v datasetu sfo_survey — místo jejich úplného odstranění. Mazání záznamů by totiž mohlo zanést do dat zkreslení, pokud by bylo potřeba vyřadit více než 5 % hodnot.
dplyr a stringr jsou načteny a dataset sfo_survey je k dispozici.
Toto cvičení je součástí kurzu
Čištění dat v R
Pokyny k cvičení
- Přidej do
sfo_surveysloupecdest_size_trimmed, který bude obsahovat hodnoty ze sloupcedest_sizes odstraněnými mezerami na začátku i na konci. - Přidej další sloupec
cleanliness_lower, který bude obsahovat hodnoty ze sloupcecleanlinesspřevedené na malá písmena. - Spočítej počet výskytů každé kategorie ve sloupci
dest_size_trimmed. - Spočítej počet výskytů každé kategorie ve sloupci
cleanliness_lower.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Add new columns to sfo_survey
sfo_survey <- sfo_survey %>%
# dest_size_trimmed: dest_size without whitespace
mutate(dest_size_trimmed = ___,
# cleanliness_lower: cleanliness converted to lowercase
cleanliness_lower = ___)
# Count values of dest_size_trimmed
sfo_survey %>%
___
# Count values of cleanliness_lower
sfo_survey %>%
___