Wikipedia क्लस्टरिंग भाग II
अब समय है कि आप पिछली एक्सरसाइज़ की पाइपलाइन को काम में लें! आपको कुछ लोकप्रिय Wikipedia आर्टिकल्स के tf-idf वर्ड-फ्रीक्वेंसी का एक array articles दिया गया है, और उनके टाइटल्स की एक लिस्ट titles दी गई है. अपनी पाइपलाइन का उपयोग करके इन Wikipedia आर्टिकल्स को क्लस्टर करें.
पिछली एक्सरसाइज़ का समाधान आपके लिए प्रीलोड कर दिया गया है, इसलिए TruncatedSVD और KMeans को चेन करने वाली एक Pipeline pipeline उपलब्ध है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Unsupervised Learning
अभ्यास निर्देश
pandasकोpdके रूप में इम्पोर्ट करें.- वर्ड-फ्रीक्वेंसी array
articlesपर पाइपलाइन को फिट करें. - क्लस्टर लेबल्स प्रेडिक्ट करें.
- आर्टिकल टाइटल्स की लिस्ट
titlesके साथ क्लस्टर लेबल्स को align करने के लिएlabelsऔरtitlesकॉलम के साथ DataFramedfबनाएँ. यह आपके लिए कर दिया गया है. - DataFrame को
'label'कॉलम से सॉर्ट करने के लिएdfकी.sort_values()मेथड का उपयोग करें, और रिज़ल्ट प्रिंट करें. - अब उत्तर सबमिट करें और अपने शानदार Wikipedia पेज क्लस्टरिंग को थोड़ा समय देकर देखें!
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import pandas
____
# Fit the pipeline to articles
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})
# Display df sorted by cluster label
print(____)