การจัดกลุ่มบทความ Wikipedia ตอนที่ 2
ถึงเวลาแล้วที่จะนำ pipeline จากแบบฝึกหัดก่อนหน้ามาใช้งานจริง! คุณจะได้รับอาร์เรย์ articles ที่เก็บความถี่ของคำในรูปแบบ tf-idf จากบทความ Wikipedia ยอดนิยม และ list titles ที่เก็บชื่อบทความเหล่านั้น ให้ใช้ pipeline เพื่อจัดกลุ่มบทความ Wikipedia
โค้ดจากแบบฝึกหัดก่อนหน้าถูกโหลดไว้ให้แล้ว ดังนั้น Pipeline pipeline ที่เชื่อมต่อ TruncatedSVD กับ KMeans จึงพร้อมใช้งาน
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Unsupervised Learning ใน Python
คำแนะนำการฝึกหัด
- Import
pandasโดยใช้ชื่อแทนว่าpd - Fit pipeline กับอาร์เรย์ความถี่ของคำ
articles - ทำนาย cluster labels
- การจับคู่ cluster labels กับ list
titlesของชื่อบทความโดยสร้าง DataFramedfที่มีคอลัมน์labelsและtitlesได้ดำเนินการให้แล้ว - ใช้เมธอด
.sort_values()ของdfเพื่อเรียงลำดับ DataFrame ตามคอลัมน์'label'แล้วแสดงผลลัพธ์ - กด ส่งคำตอบ และลองสำรวจผลการจัดกลุ่มบทความ Wikipedia ที่ได้!
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import pandas
____
# Fit the pipeline to articles
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})
# Display df sorted by cluster label
print(____)