聚类 Wikipedia(第一部分)
您在视频中看到,TruncatedSVD 能够对 csr_matrix 格式的稀疏数组(如词频数组)执行 PCA。请结合您对 TruncatedSVD 和 k-means 的了解,对一些热门的 Wikipedia 页面进行聚类。本练习中,请先构建管道。在下一练习中,您将把它应用到若干 Wikipedia 文章的词频数组上。
创建一个由 TruncatedSVD 和 KMeans 组成的 Pipeline 对象。(这一次,我们已经为您预先计算好了词频矩阵,因此无需使用 TfidfVectorizer。)
您将使用的 Wikipedia 数据集来自于此处:here。
本练习是课程的一部分
Python 中的无监督学习
练习说明
- 导入:
- 从
sklearn.decomposition导入TruncatedSVD。 - 从
sklearn.cluster导入KMeans。 - 从
sklearn.pipeline导入make_pipeline。
- 从
- 创建名为
svd的TruncatedSVD实例,设置n_components=50。 - 创建名为
kmeans的KMeans实例,设置n_clusters=6。 - 创建名为
pipeline的管道,由svd和kmeans组成。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____
# Create a TruncatedSVD instance: svd
svd = ____
# Create a KMeans instance: kmeans
kmeans = ____
# Create a pipeline: pipeline
pipeline = ____