開始使用免費開始

分群 Wikipedia(第一部分)

你在影片中看到,TruncatedSVD 可以在 csr_matrix 格式的稀疏陣列上執行 PCA,例如文字詞頻陣列。把你對 TruncatedSVD 與 k-means 的了解結合起來,為一些熱門的 Wikipedia 頁面做分群。這題先建立管線。下一題你會把它套用到多篇 Wikipedia 文章的詞頻陣列上。

建立一個由 TruncatedSVD 接著 KMeans 所組成的 Pipeline 物件。(這次我們已經幫你預先計算好詞頻矩陣,所以不需要使用 TfidfVectorizer)。

你將使用的 Wikipedia 資料集取自此處:here

本練習屬於課程

Unsupervised Learning in Python

檢視課程

練習說明

  • 匯入:
    • sklearn.decomposition 匯入 TruncatedSVD
    • sklearn.cluster 匯入 KMeans
    • sklearn.pipeline 匯入 make_pipeline
  • 建立一個名為 svdTruncatedSVD 實例,並設 n_components=50
  • 建立一個名為 kmeansKMeans 實例,並設 n_clusters=6
  • 建立一個名為 pipeline 的管線,內容依序為 svdkmeans

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____

# Create a TruncatedSVD instance: svd
svd = ____

# Create a KMeans instance: kmeans
kmeans = ____

# Create a pipeline: pipeline
pipeline = ____
編輯並執行程式碼