分群 Wikipedia(第一部分)
你在影片中看到,TruncatedSVD 可以在 csr_matrix 格式的稀疏陣列上執行 PCA,例如文字詞頻陣列。把你對 TruncatedSVD 與 k-means 的了解結合起來,為一些熱門的 Wikipedia 頁面做分群。這題先建立管線。下一題你會把它套用到多篇 Wikipedia 文章的詞頻陣列上。
建立一個由 TruncatedSVD 接著 KMeans 所組成的 Pipeline 物件。(這次我們已經幫你預先計算好詞頻矩陣,所以不需要使用 TfidfVectorizer)。
你將使用的 Wikipedia 資料集取自此處:here。
本練習屬於課程
Unsupervised Learning in Python
練習說明
- 匯入:
- 從
sklearn.decomposition匯入TruncatedSVD。 - 從
sklearn.cluster匯入KMeans。 - 從
sklearn.pipeline匯入make_pipeline。
- 從
- 建立一個名為
svd的TruncatedSVD實例,並設n_components=50。 - 建立一個名為
kmeans的KMeans實例,並設n_clusters=6。 - 建立一個名為
pipeline的管線,內容依序為svd和kmeans。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____
# Create a TruncatedSVD instance: svd
svd = ____
# Create a KMeans instance: kmeans
kmeans = ____
# Create a pipeline: pipeline
pipeline = ____