TF-IDF filmových zápletek
Použijeme záplety náhodně vybraných filmů k provádění shlukování dokumentů. Než ale shlukování spustíš, dokumenty je potřeba zbavit nežádoucího šumu (jako jsou speciální znaky a stop slova) a převést je na řídkou matici pomocí TF-IDF.
Použij třídu TfidfVectorizer k výpočtu TF-IDF filmových zápletek uložených v seznamu plots. Funkce remove_noise() je k dispozici jako tokenizer pro třídu TfidfVectorizer. Metoda .fit_transform() přizpůsobí data objektům TfidfVectorizer a následně vygeneruje řídkou matici TF-IDF.
Poznámka: Spuštění metody .fit_transform() může trvat několik sekund.
Toto cvičení je součástí kurzu
Cluster Analysis in Python
Pokyny k cvičení
- Importuj třídu
TfidfVectorizerz knihovnysklearn. - Inicializuj třídu
TfidfVectorizers minimální a maximální frekvencí 0,1 a 0,75 a maximálním počtem 50 příznaků. - Na inicializovanou třídu
TfidfVectorizeraplikuj metodufit_transform()se seznamem plots.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)
# Use the .fit_transform() method on the list plots
tfidf_matrix = ____