Clusterování Wikipedie – část II
Teď je čas pustit pipeline z předchozího cvičení do práce! Máš k dispozici pole articles s tf-idf frekvencemi slov z populárních článků na Wikipedii a seznam titles s jejich názvy. Pomocí pipeline tato články seskup do clusterů.
Řešení předchozího cvičení už je načtené, takže Pipeline pipeline řetězící TruncatedSVD s KMeans je připravená k použití.
Toto cvičení je součástí kurzu
Unsupervised Learning in Python
Pokyny k cvičení
- Naimportuj
pandasjakopd. - Přizpůsob pipeline poli word-frequency
articles. - Předpověz štítky clusterů.
- Spáruj štítky clusterů se seznamem názvů článků
titlestak, že vytvoříš DataFramedfse sloupcilabelsatitles. Tento krok už je hotový. - Pomocí metody
.sort_values()nadfseřaď DataFrame podle sloupce'label'a výsledek vypiš. - Klikni na Submit a chvíli si prohlédni, jak skvěle ses vypořádal/a s clusterováním stránek Wikipedie!
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import pandas
____
# Fit the pipeline to articles
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})
# Display df sorted by cluster label
print(____)