시작하기무료로 시작하기

거리 행렬과 덴드로그램

용어-문서 행렬(TDM)에 덴드로그램을 적용하면 간단하게 단어 클러스터 분석을 할 수 있어요. TDM이 준비되면 dist()를 호출해 행렬의 각 행 사이 차이를 계산합니다.

그다음 hclust()를 호출해 거리 행렬의 비유사도에 대해 클러스터 분석을 수행하세요. 마지막으로 덴드로그램과 plot()을 사용해 단어 빈도 간 거리를 시각화할 수 있습니다. 텍스트 마이닝에서는 덴드로그램을 통해 흥미로운 인사이트나 단어 클러스터를 발견하는 경우가 자주 있어요.

이전 영상에서 보셨던 연간 강수량 표를 떠올려 보세요. Cleveland와 Portland는 강수량이 같으므로 두 도시 간 거리는 0입니다. 두 도시는 하나의 클러스터를 이루고, 비가 훨씬 많이 오는 New Orleans는 따로 떨어질 것이라고 예상할 수 있겠죠.

       city rainfall
  Cleveland    39.14
   Portland    39.14
     Boston    43.77
New Orleans    62.45

이 연습은 강의의 일부입니다

R로 배우는 Bag-of-Words 텍스트 마이닝

강의 보기

연습 안내

데이터 프레임 rain이 작업 공간에 미리 로드되어 있습니다.

  • rain의 두 번째 열 값을 대상으로 dist() 함수를 사용해 dist_rain을 생성하세요.
  • 콘솔에 dist_rain 행렬을 출력하세요.
  • hclust()dist_rain에 적용해 클러스터 분석을 수행하고, 결과를 hc로 저장하세요.
  • 도시 이름을 추가하려면 labels = rain$city 옵션과 함께 hc 객체를 plot() 하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create dist_rain
___ <- ___(___)

# View the distance matrix
___

# Create hc
___ <- ___(___)

# Plot hc
___(___, ___)
코드 편집 및 실행