开始使用免费开始使用

K-means 聚类:第一个练习

本练习将帮助您熟悉在数据集上使用 k-means 聚类。我们将使用 Comic Con 数据集,看看 k-means 聚类在其上的表现。

回顾 k-means 聚类的两个步骤:

  • 通过 kmeans() 函数定义聚类中心。它有两个必需参数:观测值和簇的数量。
  • 通过 vq() 函数分配聚类标签。它有两个必需参数:观测值和聚类中心。

数据存储在 pandas 的 DataFrame comic_con 中。x_scaledy_scaled 是在某一时刻人群的标准化 X、Y 坐标对应的列名。

本练习是课程的一部分

Python 中的聚类分析

查看课程

练习说明

  • 在 SciPy 中导入 kmeansvq 函数。
  • 使用 kmeans() 函数并设为 2 个簇来生成聚类中心。
  • 使用这些聚类中心创建聚类标签。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____

# Generate cluster centers
cluster_centers, distortion = ____

# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____

# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled', 
                hue='cluster_labels', data = comic_con)
plt.show()
编辑并运行代码