เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การจัดกลุ่มบทความ Wikipedia ตอนที่ 2

ถึงเวลาแล้วที่จะนำ pipeline จากแบบฝึกหัดก่อนหน้ามาใช้งานจริง! คุณจะได้รับอาร์เรย์ articles ที่เก็บความถี่ของคำในรูปแบบ tf-idf จากบทความ Wikipedia ยอดนิยม และ list titles ที่เก็บชื่อบทความเหล่านั้น ให้ใช้ pipeline เพื่อจัดกลุ่มบทความ Wikipedia

โค้ดจากแบบฝึกหัดก่อนหน้าถูกโหลดไว้ให้แล้ว ดังนั้น Pipeline pipeline ที่เชื่อมต่อ TruncatedSVD กับ KMeans จึงพร้อมใช้งาน

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Unsupervised Learning ใน Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • Import pandas โดยใช้ชื่อแทนว่า pd
  • Fit pipeline กับอาร์เรย์ความถี่ของคำ articles
  • ทำนาย cluster labels
  • การจับคู่ cluster labels กับ list titles ของชื่อบทความโดยสร้าง DataFrame df ที่มีคอลัมน์ labels และ titles ได้ดำเนินการให้แล้ว
  • ใช้เมธอด .sort_values() ของ df เพื่อเรียงลำดับ DataFrame ตามคอลัมน์ 'label' แล้วแสดงผลลัพธ์
  • กด ส่งคำตอบ และลองสำรวจผลการจัดกลุ่มบทความ Wikipedia ที่ได้!

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import pandas
____

# Fit the pipeline to articles
____

# Calculate the cluster labels: labels
labels = ____

# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})

# Display df sorted by cluster label
print(____)
แก้ไขและรันโค้ด