Kom igångKom igång gratis

Rätta inkonsistenser

Nu när du har identifierat att dest_size innehåller inkonsistenta blanksteg och att cleanliness har inkonsekvent versalisering, ska du använda de nya verktygen du har till hands för att korrigera de inkonsekventa värdena i sfo_survey – i stället för att ta bort datapunkterna helt, vilket kan introducera snedvridning i datamängden om mer än 5 % av datapunkterna behöver uteslutas.

dplyr och stringr är inlästa och sfo_survey finns tillgänglig.

Den här övningen är en del av kursen

Datarensning i R

Visa kurs

Övningsinstruktioner

  • Lägg till en kolumn i sfo_survey med namnet dest_size_trimmed som innehåller värdena från kolumnen dest_size med alla inledande och avslutande blanksteg borttagna.
  • Lägg till ytterligare en kolumn med namnet cleanliness_lower som innehåller värdena från kolumnen cleanliness konverterade till gemener.
  • Räkna antalet förekomster av varje kategori i dest_size_trimmed.
  • Räkna antalet förekomster av varje kategori i cleanliness_lower.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Add new columns to sfo_survey
sfo_survey <- sfo_survey %>%
  # dest_size_trimmed: dest_size without whitespace
  mutate(dest_size_trimmed = ___,
         # cleanliness_lower: cleanliness converted to lowercase
         cleanliness_lower = ___)

# Count values of dest_size_trimmed
sfo_survey %>%
  ___

# Count values of cleanliness_lower
sfo_survey %>%
  ___
Redigera och kör kod