Clusterizarea Wikipedia – Partea I
Ai văzut în video că TruncatedSVD poate aplica PCA pe matrice rare în format csr_matrix, cum ar fi matricele de frecvență a cuvintelor. Combină cunoștințele despre TruncatedSVD și k-means pentru a clusteriza câteva pagini populare de pe Wikipedia. În acest exercițiu, construiești pipeline-ul. În exercițiul următor, îl vei aplica pe matricea de frecvență a cuvintelor din câteva articole Wikipedia.
Creează un obiect Pipeline format dintr-un TruncatedSVD urmat de KMeans. (De această dată, am precalculat matricea de frecvență a cuvintelor pentru tine, deci nu mai este nevoie de un TfidfVectorizer).
Setul de date Wikipedia cu care vei lucra a fost obținut de aici.
Acest exercițiu face parte din cursul
Învățare nesupervizată în Python
Instrucțiuni pentru exercițiu
- Importă:
TruncatedSVDdinsklearn.decomposition.KMeansdinsklearn.cluster.make_pipelinedinsklearn.pipeline.
- Creează o instanță
TruncatedSVDnumităsvdcun_components=50. - Creează o instanță
KMeansnumităkmeanscun_clusters=6. - Creează un pipeline numit
pipelineformat dinsvdșikmeans.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____
# Create a TruncatedSVD instance: svd
svd = ____
# Create a KMeans instance: kmeans
kmeans = ____
# Create a pipeline: pipeline
pipeline = ____