시작하기무료로 시작하기

특성 추출 및 분석: amzn_cons

이제 다른 바이그램 TDM에서 amzn_cons_corp 코퍼스와 대비해 보려고 합니다. 당연히 워드클라우드에서 다른 구문들이 일부 보일 것으로 기대하시겠죠.

다시 한 번, 시각화를 위한 바이그램 특성을 추출하기 위해 아래 사용자 정의 함수를 사용하겠습니다:

tokenizer <- function(x) 
  NGramTokenizer(x, Weka_control(min = 2, max = 2))

이 연습은 강의의 일부입니다

R로 배우는 Bag-of-Words 텍스트 마이닝

강의 보기

연습 안내

  • amzn_cons_corp을(를) TermDocumentMatrix로 변환하고 바이그램 함수 control = list(tokenize = tokenizer)를 적용해 amzn_c_tdm을 생성하세요.
  • amzn_c_tdm의 행렬 버전인 amzn_c_tdm_m을 생성하세요.
  • rowSums()를 사용해 amzn_c_tdm_m에서 용어 빈도를 계산하여 amzn_c_freq를 생성하세요.
  • names(amzn_c_freq)와 값 amzn_c_freq를 사용해 wordcloud()를 만드세요. 또한 max.words = 25color = "red" 인수도 사용하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create amzn_c_tdm
___ <- ___(
  ___,
  ___
)

# Create amzn_c_tdm_m
___ <- ___

# Create amzn_c_freq
___ <- ___

# Plot a word cloud of negative Amazon bigrams
___
코드 편집 및 실행