Začněte nyníZačněte zdarma

TF-IDF filmových zápletek

Použijeme záplety náhodně vybraných filmů k provádění shlukování dokumentů. Než ale shlukování spustíš, dokumenty je potřeba zbavit nežádoucího šumu (jako jsou speciální znaky a stop slova) a převést je na řídkou matici pomocí TF-IDF.

Použij třídu TfidfVectorizer k výpočtu TF-IDF filmových zápletek uložených v seznamu plots. Funkce remove_noise() je k dispozici jako tokenizer pro třídu TfidfVectorizer. Metoda .fit_transform() přizpůsobí data objektům TfidfVectorizer a následně vygeneruje řídkou matici TF-IDF.

Poznámka: Spuštění metody .fit_transform() může trvat několik sekund.

Toto cvičení je součástí kurzu

Cluster Analysis in Python

Zobrazit kurz

Pokyny k cvičení

  • Importuj třídu TfidfVectorizer z knihovny sklearn.
  • Inicializuj třídu TfidfVectorizer s minimální a maximální frekvencí 0,1 a 0,75 a maximálním počtem 50 příznaků.
  • Na inicializovanou třídu TfidfVectorizer aplikuj metodu fit_transform() se seznamem plots.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)

# Use the .fit_transform() method on the list plots
tfidf_matrix = ____
Upravit a spustit kód