維基百科分群(下)
現在該把你在上一個練習建立的管線派上用場了!你會拿到一個 articles 陣列,內含一些熱門維基百科文章的 tf-idf 詞頻,以及一個 titles 清單,存放它們的標題。請使用你的管線來對這些維基百科文章進行分群。
上一題的解答已為你預先載入,因此你可以直接使用將 TruncatedSVD 與 KMeans 串接的 Pipeline pipeline。
本練習屬於課程
Unsupervised Learning in Python
練習說明
- 將
pandas以pd匯入。 - 將管線擬合到文字詞頻陣列
articles。 - 預測叢集標籤。
- 透過建立含有
labels與titles欄位的 DataFramedf,將叢集標籤與文章標題清單titles對齊。這一步已為你完成。 - 使用
df的.sort_values()方法,依'label'欄位排序,並列印結果。 - 按下送出,花點時間觀察你對維基百科頁面的出色分群吧!
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import pandas
____
# Fit the pipeline to articles
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})
# Display df sorted by cluster label
print(____)