Začněte nyníZačněte zdarma

Nejdůležitější termíny ve shlucích filmů

Teď, když máš řídkou matici, vygeneruj středy shluků a vypiš tři nejdůležitější termíny v každém shluku. Pro převod řídké matice tfidf_matrix na běžnou matici použij metodu .todense(), aby ji funkce kmeans() mohla zpracovat. Pomocí metody .get_feature_names() pak získáš seznam termínů z objektu tfidf_vectorizer. Funkce zip() v Pythonu spojuje dva seznamy.

Objekt tfidf_vectorizer a řídká matice tfidf_matrix z předchozího cvičení jsou v tomto cvičení stále k dispozici. kmeans byl importován ze SciPy.

S větším počtem datových bodů by byly výsledné shluky lépe definované. To by ale vyžadovalo značný výpočetní výkon, takže to v rámci tohoto cvičení není prakticky proveditelné.

Toto cvičení je součástí kurzu

Cluster Analysis in Python

Zobrazit kurz

Pokyny k cvičení

  • Pomocí funkce kmeans() vygeneruj středy shluků.
  • Vygeneruj seznam termínů z objektu tfidf_vectorizer.
  • Vypiš 3 nejdůležitější termíny každého shluku.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

num_clusters = 2

# Generate cluster centers through the kmeans function
cluster_centers, distortion = ____

# Generate terms from the tfidf_vectorizer object
terms = tfidf_vectorizer.____()

for i in range(num_clusters):
    # Sort the terms and print top 3 terms
    center_terms = dict(zip(____, ____))
    sorted_terms = sorted(____, key=center_terms.get, reverse=True)
    print(____)
Upravit a spustit kód