การจัดกลุ่มบทความ Wikipedia ส่วนที่ 1
จากวิดีโอที่ผ่านมา TruncatedSVD สามารถทำ PCA บน sparse array ในรูปแบบ csr_matrix ได้ เช่น อาร์เรย์ความถี่ของคำ ลองนำความรู้เรื่อง TruncatedSVD และ k-means มารวมกันเพื่อจัดกลุ่มบทความยอดนิยมจาก Wikipedia ในแบบฝึกหัดนี้ให้สร้าง pipeline ก่อน แล้วในแบบฝึกหัดถัดไปจะนำไปใช้กับอาร์เรย์ความถี่ของคำจากบทความ Wikipedia จริง
สร้าง Pipeline object ที่ประกอบด้วย TruncatedSVD ตามด้วย KMeans (ครั้งนี้ได้คำนวณ word-frequency matrix ไว้ให้แล้ว จึงไม่จำเป็นต้องใช้ TfidfVectorizer)
ชุดข้อมูล Wikipedia ที่ใช้ในแบบฝึกหัดนี้ได้มาจาก ที่นี่
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Unsupervised Learning ใน Python
คำแนะนำการฝึกหัด
- นำเข้า:
TruncatedSVDจากsklearn.decompositionKMeansจากsklearn.clustermake_pipelineจากsklearn.pipeline
- สร้าง instance ของ
TruncatedSVDชื่อsvdโดยกำหนดn_components=50 - สร้าง instance ของ
KMeansชื่อkmeansโดยกำหนดn_clusters=6 - สร้าง pipeline ชื่อ
pipelineที่ประกอบด้วยsvdและkmeans
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____
# Create a TruncatedSVD instance: svd
svd = ____
# Create a KMeans instance: kmeans
kmeans = ____
# Create a pipeline: pipeline
pipeline = ____