Zacznij terazZacznij za darmo

Grupowanie artykułów Wikipedii – część II

Czas wykorzystać potok zbudowany w poprzednim ćwiczeniu! Masz do dyspozycji tablicę articles z częstościami słów w postaci tf-idf dla wybranych popularnych artykułów z Wikipedii oraz listę titles z ich tytułami. Użyj swojego potoku, aby pogrupować te artykuły.

Rozwiązanie poprzedniego ćwiczenia zostało już wczytane, więc potok pipeline łączący TruncatedSVD z KMeans jest gotowy do użycia.

To ćwiczenie jest częścią kursu

Uczenie nienadzorowane w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj pandas jako pd.
  • Dopasuj potok do tablicy częstości słów articles.
  • Przewidź etykiety skupień.
  • Połącz etykiety skupień z listą tytułów artykułów titles, tworząc ramkę danych df z kolumnami labels i titles. Ten krok został już wykonany za ciebie.
  • Użyj metody .sort_values() na df, aby posortować ramkę danych według kolumny 'label', i wydrukuj wynik.
  • Kliknij Prześlij odpowiedź i poświęć chwilę, żeby przyjrzeć się efektom grupowania artykułów Wikipedii!

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import pandas
____

# Fit the pipeline to articles
____

# Calculate the cluster labels: labels
labels = ____

# Create a DataFrame aligning labels and titles: df
df = pd.DataFrame({'label': labels, 'article': titles})

# Display df sorted by cluster label
print(____)
Edytuj i uruchom kod