특성 추출 및 분석: amzn_cons
이제 다른 바이그램 TDM에서 amzn_cons_corp 코퍼스와 대비해 보려고 합니다. 당연히 워드클라우드에서 다른 구문들이 일부 보일 것으로 기대하시겠죠.
다시 한 번, 시각화를 위한 바이그램 특성을 추출하기 위해 아래 사용자 정의 함수를 사용하겠습니다:
tokenizer <- function(x)
NGramTokenizer(x, Weka_control(min = 2, max = 2))
이 연습은 강의의 일부입니다
R로 배우는 Bag-of-Words 텍스트 마이닝
연습 안내
amzn_cons_corp을(를)TermDocumentMatrix로 변환하고 바이그램 함수control = list(tokenize = tokenizer)를 적용해amzn_c_tdm을 생성하세요.amzn_c_tdm의 행렬 버전인amzn_c_tdm_m을 생성하세요.rowSums()를 사용해amzn_c_tdm_m에서 용어 빈도를 계산하여amzn_c_freq를 생성하세요.names(amzn_c_freq)와 값amzn_c_freq를 사용해wordcloud()를 만드세요. 또한max.words = 25와color = "red"인수도 사용하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create amzn_c_tdm
___ <- ___(
___,
___
)
# Create amzn_c_tdm_m
___ <- ___
# Create amzn_c_freq
___ <- ___
# Plot a word cloud of negative Amazon bigrams
___