Grupowanie artykułów Wikipedii – część II
Czas wykorzystać potok zbudowany w poprzednim ćwiczeniu! Masz do dyspozycji tablicę articles z częstościami słów w postaci tf-idf dla wybranych popularnych artykułów z Wikipedii oraz listę titles z ich tytułami. Użyj swojego potoku, aby pogrupować te artykuły.
Rozwiązanie poprzedniego ćwiczenia zostało już wczytane, więc potok pipeline łączący TruncatedSVD z KMeans jest gotowy do użycia.
To ćwiczenie jest częścią kursu
Uczenie nienadzorowane w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj
pandasjakopd. - Dopasuj potok do tablicy częstości słów
articles. - Przewidź etykiety skupień.
- Połącz etykiety skupień z listą tytułów artykułów
titles, tworząc ramkę danychdfz kolumnamilabelsititles. Ten krok został już wykonany za ciebie. - Użyj metody
.sort_values()nadf, aby posortować ramkę danych według kolumny'label', i wydrukuj wynik. - Kliknij Prześlij odpowiedź i poświęć chwilę, żeby przyjrzeć się efektom grupowania artykułów Wikipedii!
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import pandas
____
# Fit the pipeline to articles
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})
# Display df sorted by cluster label
print(____)