K-means 聚类:第一个练习
本练习将帮助您熟悉在数据集上使用 k-means 聚类。我们将使用 Comic Con 数据集,看看 k-means 聚类在其上的表现。
回顾 k-means 聚类的两个步骤:
- 通过
kmeans()函数定义聚类中心。它有两个必需参数:观测值和簇的数量。 - 通过
vq()函数分配聚类标签。它有两个必需参数:观测值和聚类中心。
数据存储在 pandas 的 DataFrame comic_con 中。x_scaled 和 y_scaled 是在某一时刻人群的标准化 X、Y 坐标对应的列名。
本练习是课程的一部分
Python 中的聚类分析
练习说明
- 在 SciPy 中导入
kmeans和vq函数。 - 使用
kmeans()函数并设为 2 个簇来生成聚类中心。 - 使用这些聚类中心创建聚类标签。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____
# Generate cluster centers
cluster_centers, distortion = ____
# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____
# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled',
hue='cluster_labels', data = comic_con)
plt.show()