Regrouper des pages Wikipédia, partie I
Vous avez vu dans la vidéo que TruncatedSVD peut effectuer une ACP (PCA) sur des tableaux creux au format csr_matrix, comme les tableaux de fréquences de mots. Combinez vos connaissances de TruncatedSVD et de k-means pour regrouper quelques pages populaires de Wikipédia. Dans cet exercice, construisez la chaîne de traitement (pipeline). Dans le prochain, vous l'appliquerez au tableau de fréquences de mots de certains articles de Wikipédia.
Créez un objet Pipeline composé d'un TruncatedSVD suivi de KMeans. (Cette fois, nous avons déjà calculé la matrice de fréquences de mots pour vous, donc pas besoin de TfidfVectorizer).
Le jeu de données Wikipédia que vous utiliserez provient d'ici.
Cette activité fait partie du cours
Unsupervised Learning in Python
Instructions de l’exercice
- Importez :
TruncatedSVDdesklearn.decomposition.KMeansdesklearn.cluster.make_pipelinedesklearn.pipeline.
- Créez une instance de
TruncatedSVDappeléesvdavecn_components=50. - Créez une instance de
KMeansappeléekmeansavecn_clusters=6. - Créez une chaîne de traitement appelée
pipelinecomposée desvdetkmeans.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____
# Create a TruncatedSVD instance: svd
svd = ____
# Create a KMeans instance: kmeans
kmeans = ____
# Create a pipeline: pipeline
pipeline = ____