시작하기무료로 시작하기

amzn_cons 덴드로그램

리뷰를 보면 장시간 근무와 좋지 않은 워라밸에 대한 신호가 강하게 보입니다. 간단한 군집화 기법으로, 계층적 군집화를 수행하고 덴드로그램을 만들어 이런 구문들이 얼마나 연관되어 있는지 확인해 보려고 합니다.

이 연습은 강의의 일부입니다

R로 배우는 Bag-of-Words 텍스트 마이닝

강의 보기

연습 안내

  • amzn_cons_corp를 사용해 control = list(tokenize = tokenizer)를 지정하고, TermDocumentMatrixamzn_c_tdm을 생성하세요.
  • 콘솔에 amzn_c_tdm을 출력하세요.
  • removeSparseTerms() 함수를 amzn_c_tdm에 적용하고 sparse 인자를 .993로 하여 amzn_c_tdm2를 만드세요.
  • 거리 행렬 dist(amzn_c_tdm2)hclust() 함수에 중첩해 전달하고, method = "complete"도 함께 지정하여 계층적 군집 객체 hc를 만드세요.
  • hc를 플로팅하여 클러스터링된 바이그램을 확인하고, Amazon 단점(cons) 섹션의 개념들이 어떻게 결론으로 이어질 수 있는지 살펴보세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create amzn_c_tdm
___ <- ___(
  ___,
  ___
)

# Print amzn_c_tdm to the console
___

# Create amzn_c_tdm2 by removing sparse terms 
___ <- ___

# Create hc as a cluster of distance values
___ <- ___(___,
           ___)

# Produce a plot of hc
___
코드 편집 및 실행