불일치 수정하기
dest_size에 공백 불일치가 있고 cleanliness에 대소문자 불일치가 있다는 것을 확인했으니, 이제는 새로 배운 도구를 사용해 sfo_survey의 불일치 값을 수정해 보려고 해요. 데이터를 전부 제거하는 대신 수정하면, 데이터 포인트의 5% 이상을 제거해야 하는 경우 발생할 수 있는 편향을 줄일 수 있어요.
dplyr와 stringr는 로드되어 있고 sfo_survey를 사용할 수 있어요.
이 연습은 강의의 일부입니다
R로 데이터 정리하기
연습 안내
sfo_survey에dest_size_trimmed라는 열을 추가하고,dest_size열의 값에서 앞뒤 공백을 모두 제거한 값을 넣으세요.cleanliness_lower라는 열을 하나 더 추가하고,cleanliness열의 값을 모두 소문자로 변환해 넣으세요.dest_size_trimmed의 각 범주가 몇 번 나타나는지 개수를 세세요.cleanliness_lower의 각 범주가 몇 번 나타나는지 개수를 세세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Add new columns to sfo_survey
sfo_survey <- sfo_survey %>%
# dest_size_trimmed: dest_size without whitespace
mutate(dest_size_trimmed = ___,
# cleanliness_lower: cleanliness converted to lowercase
cleanliness_lower = ___)
# Count values of dest_size_trimmed
sfo_survey %>%
___
# Count values of cleanliness_lower
sfo_survey %>%
___