Regrouper des articles Wikipédia – partie II
Il est maintenant temps de mettre au travail votre pipeline de l'exercice précédent ! On vous fournit un tableau articles contenant les fréquences de mots tf-idf de certains articles Wikipédia populaires, ainsi qu'une liste titles de leurs titres. Utilisez votre pipeline pour regrouper les articles Wikipédia.
Une solution à l'exercice précédent a été préchargée pour vous ; un objet Pipeline pipeline enchaînant TruncatedSVD et KMeans est donc disponible.
Cette activité fait partie du cours
Unsupervised Learning in Python
Instructions de l’exercice
- Importez
pandassous le nompd. - Ajustez le pipeline au tableau de fréquences de mots
articles. - Prédisez les étiquettes de regroupement.
- Alignez les étiquettes de regroupement avec la liste
titlesdes titres d'articles en créant un DataFramedfaveclabelsettitlescomme colonnes. Cela a été fait pour vous. - Utilisez la méthode
.sort_values()dedfpour trier le DataFrame selon la colonne'label', puis affichez le résultat. - Appuyez sur Soumettre et prenez un moment pour examiner votre superbe regroupement de pages Wikipédia !
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import pandas
____
# Fit the pipeline to articles
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})
# Display df sorted by cluster label
print(____)