TF-IDF al rezumatelor de filme
Vom folosi rezumatele unor filme selectate aleatoriu pentru a realiza gruparea documentelor. Înainte de grupare, documentele trebuie curățate de zgomot nedorit (cum ar fi caractere speciale și cuvinte de legătură) și convertite într-o matrice rară prin TF-IDF.
Folosește clasa TfidfVectorizer pentru a calcula TF-IDF al rezumatelor de filme stocate în lista plots. Funcția remove_noise() este disponibilă pentru a fi utilizată ca tokenizer în clasa TfidfVectorizer. Metoda .fit_transform() ajustează datele în obiectul TfidfVectorizer și generează matricea rară TF-IDF.
Notă: Rularea metodei .fit_transform() durează câteva secunde.
Acest exercițiu face parte din cursul
Analiza clusterelor în Python
Instrucțiuni pentru exercițiu
- Importă clasa
TfidfVectorizerdinsklearn. - Inițializează clasa
TfidfVectorizercu frecvențe minimă și maximă de 0,1 și, respectiv, 0,75, și un număr maxim de 50 de caracteristici. - Aplică metoda
fit_transform()pe clasaTfidfVectorizerinițializată, folosind listaplots.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)
# Use the .fit_transform() method on the list plots
tfidf_matrix = ____