Klustra Wikipedia, del II
Nu är det dags att sätta igång pipeline:n från föregående övning! Du får en matris articles med tf-idf-ordfrekvenser för några populära Wikipedia-artiklar, samt en lista titles med deras titlar. Använd din pipeline för att klustra Wikipedia-artiklarna.
En lösning på föregående övning har laddats in åt dig, så en Pipeline pipeline som kedjar TruncatedSVD med KMeans finns tillgänglig.
Den här övningen är en del av kursen
Oövervakad inlärning i Python
Övningsinstruktioner
- Importera
pandassompd. - Anpassa pipeline:n till ordfrekvensmatrisen
articles. - Förutsäg klusteretiketterna.
- Koppla klusteretiketterna till listan
titlesmed artikelnamn genom att skapa en DataFramedfmedlabelsochtitlessom kolumner. Det har redan gjorts åt dig. - Använd metoden
.sort_values()pådfför att sortera DataFrame:n efter kolumnen'label', och skriv ut resultatet. - Klicka på Skicka in svar och ta en stund att utforska din imponerande klustring av Wikipedia-sidor!
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import pandas
____
# Fit the pipeline to articles
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})
# Display df sorted by cluster label
print(____)