Začněte nyníZačněte zdarma

Oprava nekonzistencí

Teď, když víš, že sloupec dest_size obsahuje nekonzistentní mezery a sloupec cleanliness nekonzistentní velikost písmen, použiješ nové nástroje k opravě těchto hodnot v datasetu sfo_survey — místo jejich úplného odstranění. Mazání záznamů by totiž mohlo zanést do dat zkreslení, pokud by bylo potřeba vyřadit více než 5 % hodnot.

dplyr a stringr jsou načteny a dataset sfo_survey je k dispozici.

Toto cvičení je součástí kurzu

Čištění dat v R

Zobrazit kurz

Pokyny k cvičení

  • Přidej do sfo_survey sloupec dest_size_trimmed, který bude obsahovat hodnoty ze sloupce dest_size s odstraněnými mezerami na začátku i na konci.
  • Přidej další sloupec cleanliness_lower, který bude obsahovat hodnoty ze sloupce cleanliness převedené na malá písmena.
  • Spočítej počet výskytů každé kategorie ve sloupci dest_size_trimmed.
  • Spočítej počet výskytů každé kategorie ve sloupci cleanliness_lower.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Add new columns to sfo_survey
sfo_survey <- sfo_survey %>%
  # dest_size_trimmed: dest_size without whitespace
  mutate(dest_size_trimmed = ___,
         # cleanliness_lower: cleanliness converted to lowercase
         cleanliness_lower = ___)

# Count values of dest_size_trimmed
sfo_survey %>%
  ___

# Count values of cleanliness_lower
sfo_survey %>%
  ___
Upravit a spustit kód