Kom igångKom igång gratis

Klustring av Wikipedia – del I

I videon såg du att TruncatedSVD kan utföra PCA på glesa matriser i csr_matrix-format, till exempel ordfrekvensmatriser. Kombinera dina kunskaper om TruncatedSVD och k-means för att klustra några populära Wikipedia-sidor. I den här övningen bygger du pipelinen. I nästa övning tillämpar du den på en ordfrekvensmatris för några Wikipedia-artiklar.

Skapa ett Pipeline-objekt som består av en TruncatedSVD följt av KMeans. (Den här gången har vi förberäknat ordfrekvensmatrisen åt dig, så du behöver ingen TfidfVectorizer).

Wikipedia-datamängden du kommer att arbeta med hämtades från här.

Den här övningen är en del av kursen

Oövervakad inlärning i Python

Visa kurs

Övningsinstruktioner

  • Importera:
    • TruncatedSVD från sklearn.decomposition.
    • KMeans från sklearn.cluster.
    • make_pipeline från sklearn.pipeline.
  • Skapa en TruncatedSVD-instans kallad svd med n_components=50.
  • Skapa en KMeans-instans kallad kmeans med n_clusters=6.
  • Skapa en pipeline kallad pipeline bestående av svd och kmeans.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Perform the necessary imports
from ____ import ____
from ____ import ____
from ____ import ____

# Create a TruncatedSVD instance: svd
svd = ____

# Create a KMeans instance: kmeans
kmeans = ____

# Create a pipeline: pipeline
pipeline = ____
Redigera och kör kod