開始使用免費開始

維基百科分群(下)

現在該把你在上一個練習建立的管線派上用場了!你會拿到一個 articles 陣列,內含一些熱門維基百科文章的 tf-idf 詞頻,以及一個 titles 清單,存放它們的標題。請使用你的管線來對這些維基百科文章進行分群。

上一題的解答已為你預先載入,因此你可以直接使用將 TruncatedSVD 與 KMeans 串接的 Pipeline pipeline

本練習屬於課程

Unsupervised Learning in Python

檢視課程

練習說明

  • pandaspd 匯入。
  • 將管線擬合到文字詞頻陣列 articles
  • 預測叢集標籤。
  • 透過建立含有 labelstitles 欄位的 DataFrame df,將叢集標籤與文章標題清單 titles 對齊。這一步已為你完成。
  • 使用 df.sort_values() 方法,依 'label' 欄位排序,並列印結果。
  • 按下送出,花點時間觀察你對維基百科頁面的出色分群吧!

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import pandas
____

# Fit the pipeline to articles
____

# Calculate the cluster labels: labels
labels = ____

# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})

# Display df sorted by cluster label
print(____)
編輯並執行程式碼