Kom igångKom igång gratis

Klustra Wikipedia, del II

Nu är det dags att sätta igång pipeline:n från föregående övning! Du får en matris articles med tf-idf-ordfrekvenser för några populära Wikipedia-artiklar, samt en lista titles med deras titlar. Använd din pipeline för att klustra Wikipedia-artiklarna.

En lösning på föregående övning har laddats in åt dig, så en Pipeline pipeline som kedjar TruncatedSVD med KMeans finns tillgänglig.

Den här övningen är en del av kursen

Oövervakad inlärning i Python

Visa kurs

Övningsinstruktioner

  • Importera pandas som pd.
  • Anpassa pipeline:n till ordfrekvensmatrisen articles.
  • Förutsäg klusteretiketterna.
  • Koppla klusteretiketterna till listan titles med artikelnamn genom att skapa en DataFrame df med labels och titles som kolumner. Det har redan gjorts åt dig.
  • Använd metoden .sort_values()df för att sortera DataFrame:n efter kolumnen 'label', och skriv ut resultatet.
  • Klicka på Skicka in svar och ta en stund att utforska din imponerande klustring av Wikipedia-sidor!

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import pandas
____

# Fit the pipeline to articles
____

# Calculate the cluster labels: labels
labels = ____

# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})

# Display df sorted by cluster label
print(____)
Redigera och kör kod