시작하기무료로 시작하기

정제와 개수 세기

twitter_data에서 불용어를 제거해, 불만으로 분류된 항공사 트윗의 실제 내용을 살펴보세요.

이 연습은 강의의 일부입니다

R로 시작하는 텍스트 분석

강의 보기

연습 안내

  • twitter_data의 트윗을 토큰화하세요. 토큰화된 단어 열 이름은 word로 지정하세요.
  • 토큰화된 twitter_data에서 기본 불용어를 제거하세요.
  • 불만에 해당하는 행만 필터링해서 남기세요.
  • 토큰화하고 정제한 텍스트로 단어 빈도를 계산하고, 개수 기준 내림차순으로 정렬하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

tidy_twitter <- twitter_data %>% 
  # Tokenize the twitter data
  ___(___, ___) %>% 
  # Remove stop words
  anti_join(stop_words)

tidy_twitter %>% 
  # Filter to keep complaints only
  ___(___ == ___) %>% 
  # Compute word counts and arrange in descending order
  ___(___) %>% 
  ___(___)
코드 편집 및 실행