Rätta inkonsistenser
Nu när du har identifierat att dest_size innehåller inkonsistenta blanksteg och att cleanliness har inkonsekvent versalisering, ska du använda de nya verktygen du har till hands för att korrigera de inkonsekventa värdena i sfo_survey – i stället för att ta bort datapunkterna helt, vilket kan introducera snedvridning i datamängden om mer än 5 % av datapunkterna behöver uteslutas.
dplyr och stringr är inlästa och sfo_survey finns tillgänglig.
Den här övningen är en del av kursen
Datarensning i R
Övningsinstruktioner
- Lägg till en kolumn i
sfo_surveymed namnetdest_size_trimmedsom innehåller värdena från kolumnendest_sizemed alla inledande och avslutande blanksteg borttagna. - Lägg till ytterligare en kolumn med namnet
cleanliness_lowersom innehåller värdena från kolumnencleanlinesskonverterade till gemener. - Räkna antalet förekomster av varje kategori i
dest_size_trimmed. - Räkna antalet förekomster av varje kategori i
cleanliness_lower.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Add new columns to sfo_survey
sfo_survey <- sfo_survey %>%
# dest_size_trimmed: dest_size without whitespace
mutate(dest_size_trimmed = ___,
# cleanliness_lower: cleanliness converted to lowercase
cleanliness_lower = ___)
# Count values of dest_size_trimmed
sfo_survey %>%
___
# Count values of cleanliness_lower
sfo_survey %>%
___