amzn_cons 덴드로그램
리뷰를 보면 장시간 근무와 좋지 않은 워라밸에 대한 신호가 강하게 보입니다. 간단한 군집화 기법으로, 계층적 군집화를 수행하고 덴드로그램을 만들어 이런 구문들이 얼마나 연관되어 있는지 확인해 보려고 합니다.
이 연습은 강의의 일부입니다
R로 배우는 Bag-of-Words 텍스트 마이닝
연습 안내
amzn_cons_corp를 사용해control = list(tokenize = tokenizer)를 지정하고,TermDocumentMatrix로amzn_c_tdm을 생성하세요.- 콘솔에
amzn_c_tdm을 출력하세요. removeSparseTerms()함수를amzn_c_tdm에 적용하고sparse인자를.993로 하여amzn_c_tdm2를 만드세요.- 거리 행렬
dist(amzn_c_tdm2)를hclust()함수에 중첩해 전달하고,method = "complete"도 함께 지정하여 계층적 군집 객체hc를 만드세요. hc를 플로팅하여 클러스터링된 바이그램을 확인하고, Amazon 단점(cons) 섹션의 개념들이 어떻게 결론으로 이어질 수 있는지 살펴보세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create amzn_c_tdm
___ <- ___(
___,
___
)
# Print amzn_c_tdm to the console
___
# Create amzn_c_tdm2 by removing sparse terms
___ <- ___
# Create hc as a cluster of distance values
___ <- ___(___,
___)
# Produce a plot of hc
___