시작하기무료로 시작하기

K-평균 클러스터링: 첫 번째 연습

이 연습 문제에서는 데이터셋에 k-평균 클러스터링을 적용하는 방법에 익숙해지실 거예요. Comic Con 데이터셋을 사용해 k-평균 클러스터링이 어떻게 동작하는지 확인해 봅시다.

k-평균 클러스터링의 두 단계를 기억하세요:

  • kmeans() 함수로 클러스터 중심을 정의해요. 필수 인자는 두 가지이며, 관측값과 클러스터 개수예요.
  • vq() 함수로 클러스터 레이블을 할당해요. 필수 인자는 두 가지이며, 관측값과 클러스터 중심이에요.

데이터는 pandas DataFrame인 comic_con에 저장되어 있어요. x_scaledy_scaled는 특정 시점에 사람들의 X, Y 좌표를 표준화한 열 이름이에요.

이 연습은 강의의 일부입니다

Python으로 배우는 군집 분석

강의 보기

연습 안내

  • SciPy에서 kmeansvq 함수를 임포트하세요.
  • kmeans() 함수로 두 개의 클러스터 중심을 생성하세요.
  • 이렇게 얻은 클러스터 중심으로 클러스터 레이블을 생성하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____

# Generate cluster centers
cluster_centers, distortion = ____

# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____

# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled', 
                hue='cluster_labels', data = comic_con)
plt.show()
코드 편집 및 실행