정제와 개수 세기
twitter_data에서 불용어를 제거해, 불만으로 분류된 항공사 트윗의 실제 내용을 살펴보세요.
이 연습은 강의의 일부입니다
R로 시작하는 텍스트 분석
연습 안내
twitter_data의 트윗을 토큰화하세요. 토큰화된 단어 열 이름은word로 지정하세요.- 토큰화된
twitter_data에서 기본 불용어를 제거하세요. - 불만에 해당하는 행만 필터링해서 남기세요.
- 토큰화하고 정제한 텍스트로 단어 빈도를 계산하고, 개수 기준 내림차순으로 정렬하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
tidy_twitter <- twitter_data %>%
# Tokenize the twitter data
___(___, ___) %>%
# Remove stop words
anti_join(stop_words)
tidy_twitter %>%
# Filter to keep complaints only
___(___ == ___) %>%
# Compute word counts and arrange in descending order
___(___) %>%
___(___)