Klustring av Wikipedia – del I
I videon såg du att TruncatedSVD kan utföra PCA på glesa matriser i csr_matrix-format, till exempel ordfrekvensmatriser. Kombinera dina kunskaper om TruncatedSVD och k-means för att klustra några populära Wikipedia-sidor. I den här övningen bygger du pipelinen. I nästa övning tillämpar du den på en ordfrekvensmatris för några Wikipedia-artiklar.
Skapa ett Pipeline-objekt som består av en TruncatedSVD följt av KMeans. (Den här gången har vi förberäknat ordfrekvensmatrisen åt dig, så du behöver ingen TfidfVectorizer).
Wikipedia-datamängden du kommer att arbeta med hämtades från här.
Den här övningen är en del av kursen
Oövervakad inlärning i Python
Övningsinstruktioner
- Importera:
TruncatedSVDfrånsklearn.decomposition.KMeansfrånsklearn.cluster.make_pipelinefrånsklearn.pipeline.
- Skapa en
TruncatedSVD-instans kalladsvdmedn_components=50. - Skapa en
KMeans-instans kalladkmeansmedn_clusters=6. - Skapa en pipeline kallad
pipelinebestående avsvdochkmeans.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____
# Create a TruncatedSVD instance: svd
svd = ____
# Create a KMeans instance: kmeans
kmeans = ____
# Create a pipeline: pipeline
pipeline = ____