เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การจัดกลุ่มบทความ Wikipedia ส่วนที่ 1

จากวิดีโอที่ผ่านมา TruncatedSVD สามารถทำ PCA บน sparse array ในรูปแบบ csr_matrix ได้ เช่น อาร์เรย์ความถี่ของคำ ลองนำความรู้เรื่อง TruncatedSVD และ k-means มารวมกันเพื่อจัดกลุ่มบทความยอดนิยมจาก Wikipedia ในแบบฝึกหัดนี้ให้สร้าง pipeline ก่อน แล้วในแบบฝึกหัดถัดไปจะนำไปใช้กับอาร์เรย์ความถี่ของคำจากบทความ Wikipedia จริง

สร้าง Pipeline object ที่ประกอบด้วย TruncatedSVD ตามด้วย KMeans (ครั้งนี้ได้คำนวณ word-frequency matrix ไว้ให้แล้ว จึงไม่จำเป็นต้องใช้ TfidfVectorizer)

ชุดข้อมูล Wikipedia ที่ใช้ในแบบฝึกหัดนี้ได้มาจาก ที่นี่

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Unsupervised Learning ใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • นำเข้า:
    • TruncatedSVD จาก sklearn.decomposition
    • KMeans จาก sklearn.cluster
    • make_pipeline จาก sklearn.pipeline
  • สร้าง instance ของ TruncatedSVD ชื่อ svd โดยกำหนด n_components=50
  • สร้าง instance ของ KMeans ชื่อ kmeans โดยกำหนด n_clusters=6
  • สร้าง pipeline ชื่อ pipeline ที่ประกอบด้วย svd และ kmeans

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____

# Create a TruncatedSVD instance: svd
svd = ____

# Create a KMeans instance: kmeans
kmeans = ____

# Create a pipeline: pipeline
pipeline = ____
แก้ไขและรันโค้ด