ÎncepețiÎncepe gratuit

TF-IDF al rezumatelor de filme

Vom folosi rezumatele unor filme selectate aleatoriu pentru a realiza gruparea documentelor. Înainte de grupare, documentele trebuie curățate de zgomot nedorit (cum ar fi caractere speciale și cuvinte de legătură) și convertite într-o matrice rară prin TF-IDF.

Folosește clasa TfidfVectorizer pentru a calcula TF-IDF al rezumatelor de filme stocate în lista plots. Funcția remove_noise() este disponibilă pentru a fi utilizată ca tokenizer în clasa TfidfVectorizer. Metoda .fit_transform() ajustează datele în obiectul TfidfVectorizer și generează matricea rară TF-IDF.

Notă: Rularea metodei .fit_transform() durează câteva secunde.

Acest exercițiu face parte din cursul

Analiza clusterelor în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă clasa TfidfVectorizer din sklearn.
  • Inițializează clasa TfidfVectorizer cu frecvențe minimă și maximă de 0,1 și, respectiv, 0,75, și un număr maxim de 50 de caracteristici.
  • Aplică metoda fit_transform() pe clasa TfidfVectorizer inițializată, folosind lista plots.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)

# Use the .fit_transform() method on the list plots
tfidf_matrix = ____
Editează și rulează codul