거리 행렬과 덴드로그램
용어-문서 행렬(TDM)에 덴드로그램을 적용하면 간단하게 단어 클러스터 분석을 할 수 있어요. TDM이 준비되면 dist()를 호출해 행렬의 각 행 사이 차이를 계산합니다.
그다음 hclust()를 호출해 거리 행렬의 비유사도에 대해 클러스터 분석을 수행하세요. 마지막으로 덴드로그램과 plot()을 사용해 단어 빈도 간 거리를 시각화할 수 있습니다. 텍스트 마이닝에서는 덴드로그램을 통해 흥미로운 인사이트나 단어 클러스터를 발견하는 경우가 자주 있어요.
이전 영상에서 보셨던 연간 강수량 표를 떠올려 보세요. Cleveland와 Portland는 강수량이 같으므로 두 도시 간 거리는 0입니다. 두 도시는 하나의 클러스터를 이루고, 비가 훨씬 많이 오는 New Orleans는 따로 떨어질 것이라고 예상할 수 있겠죠.
city rainfall
Cleveland 39.14
Portland 39.14
Boston 43.77
New Orleans 62.45
이 연습은 강의의 일부입니다
R로 배우는 Bag-of-Words 텍스트 마이닝
연습 안내
데이터 프레임 rain이 작업 공간에 미리 로드되어 있습니다.
rain의 두 번째 열 값을 대상으로dist()함수를 사용해dist_rain을 생성하세요.- 콘솔에
dist_rain행렬을 출력하세요. hclust()를dist_rain에 적용해 클러스터 분석을 수행하고, 결과를hc로 저장하세요.- 도시 이름을 추가하려면
labels = rain$city옵션과 함께hc객체를plot()하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create dist_rain
___ <- ___(___)
# View the distance matrix
___
# Create hc
___ <- ___(___)
# Plot hc
___(___, ___)