Začněte nyníZačněte zdarma

Clusterování Wikipedie – část II

Teď je čas pustit pipeline z předchozího cvičení do práce! Máš k dispozici pole articles s tf-idf frekvencemi slov z populárních článků na Wikipedii a seznam titles s jejich názvy. Pomocí pipeline tato články seskup do clusterů.

Řešení předchozího cvičení už je načtené, takže Pipeline pipeline řetězící TruncatedSVD s KMeans je připravená k použití.

Toto cvičení je součástí kurzu

Unsupervised Learning in Python

Zobrazit kurz

Pokyny k cvičení

  • Naimportuj pandas jako pd.
  • Přizpůsob pipeline poli word-frequency articles.
  • Předpověz štítky clusterů.
  • Spáruj štítky clusterů se seznamem názvů článků titles tak, že vytvoříš DataFrame df se sloupci labels a titles. Tento krok už je hotový.
  • Pomocí metody .sort_values() na df seřaď DataFrame podle sloupce 'label' a výsledek vypiš.
  • Klikni na Submit a chvíli si prohlédni, jak skvěle ses vypořádal/a s clusterováním stránek Wikipedie!

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import pandas
____

# Fit the pipeline to articles
____

# Calculate the cluster labels: labels
labels = ____

# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})

# Display df sorted by cluster label
print(____)
Upravit a spustit kód