시작하기무료로 시작하기

시드가 개별 클러스터에 미치는 영향

이전에는 클러스터가 뚜렷하지 않은 데이터셋에서 시드가 결과에 미치는 영향을 살펴봤어요. 이번 연습에서는 클러스터가 뚜렷한 Comic Con 데이터에서도 시드가 클러스터에 영향을 주는지 확인해 보겠습니다.

데이터는 pandas DataFrame인 comic_con에 저장되어 있어요. x_scaledy_scaled는 특정 시점에 사람들의 X, Y 좌표를 표준화한 열 이름입니다.

이 연습은 강의의 일부입니다

Python으로 배우는 군집 분석

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Import random class
____

# Initialize seed
random.____(____)

# Run kmeans clustering
cluster_centers, distortion = kmeans(comic_con[['x_scaled', 'y_scaled']], 2)
comic_con['cluster_labels'], distortion_list = vq(comic_con[['x_scaled', 'y_scaled']], cluster_centers)

# Plot the scatterplot
sns.scatterplot(x='x_scaled', y='y_scaled', 
                hue='cluster_labels', data = comic_con)
plt.show()
코드 편집 및 실행