특성 추출 및 분석: amzn_pros
amzn_pros_corp, amzn_cons_corp, goog_pros_corp, 그리고 goog_cons_corp는 모두 전처리가 완료되었으니, 이제 살펴보고자 하는 특성을 추출할 수 있어요. Bag-of-words 접근 방식을 사용하므로, Amazon의 긍정 리뷰 코퍼스인 amzn_pros_corp에서 바이그램 TermDocumentMatrix를 만들기로 했어요. 이를 통해 사람들이 Amazon에서 일하는 것과 긍정적으로 연관 짓는 구절이 무엇인지 wordcloud()로 빠르게 파악할 수 있어요.
아래 함수는 RWeka를 이용해 두 단어로 토크나이즈하며, 이 연습 문제에서 내부적으로 사용돼요.
tokenizer <- function(x) {
NGramTokenizer(x, Weka_control(min = 2, max = 2))
}
이 연습은 강의의 일부입니다
R로 배우는 Bag-of-Words 텍스트 마이닝
연습 안내
amzn_pros_corp에서TermDocumentMatrix를 만들어amzn_p_tdm으로 저장하세요. 용어가 바이그램이 되도록control = list(tokenize = tokenizer)를 추가하세요.as.matrix()함수를 사용해amzn_p_tdm에서amzn_p_tdm_m을 만드세요.amzn_p_tdm_m에서 용어 빈도를 얻어amzn_p_freq로 저장하세요.names(amzn_p_freq)를 단어로,amzn_p_freq를 빈도로 사용하고,max.words = 25,color = "blue"로 설정해wordcloud()를 만드세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create amzn_p_tdm
___ <- ___(
___,
___
)
# Create amzn_p_tdm_m
___ <- ___
# Create amzn_p_freq
___ <- ___
# Plot a word cloud using amzn_p_freq values
___(___)