시작하기무료로 시작하기

특성 추출 및 분석: amzn_pros

amzn_pros_corp, amzn_cons_corp, goog_pros_corp, 그리고 goog_cons_corp는 모두 전처리가 완료되었으니, 이제 살펴보고자 하는 특성을 추출할 수 있어요. Bag-of-words 접근 방식을 사용하므로, Amazon의 긍정 리뷰 코퍼스인 amzn_pros_corp에서 바이그램 TermDocumentMatrix를 만들기로 했어요. 이를 통해 사람들이 Amazon에서 일하는 것과 긍정적으로 연관 짓는 구절이 무엇인지 wordcloud()로 빠르게 파악할 수 있어요.

아래 함수는 RWeka를 이용해 두 단어로 토크나이즈하며, 이 연습 문제에서 내부적으로 사용돼요.

tokenizer <- function(x) {
  NGramTokenizer(x, Weka_control(min = 2, max = 2))
}

이 연습은 강의의 일부입니다

R로 배우는 Bag-of-Words 텍스트 마이닝

강의 보기

연습 안내

  • amzn_pros_corp에서 TermDocumentMatrix를 만들어 amzn_p_tdm으로 저장하세요. 용어가 바이그램이 되도록 control = list(tokenize = tokenizer)를 추가하세요.
  • as.matrix() 함수를 사용해 amzn_p_tdm에서 amzn_p_tdm_m을 만드세요.
  • amzn_p_tdm_m에서 용어 빈도를 얻어 amzn_p_freq로 저장하세요.
  • names(amzn_p_freq)를 단어로, amzn_p_freq를 빈도로 사용하고, max.words = 25, color = "blue"로 설정해 wordcloud()를 만드세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create amzn_p_tdm
___ <- ___(
  ___,
  ___
)

# Create amzn_p_tdm_m
___ <- ___

# Create amzn_p_freq
___ <- ___

# Plot a word cloud using amzn_p_freq values
___(___)
코드 편집 및 실행