ÎncepețiÎncepe gratuit

Un array de frecvențe tf-idf

În acest exercițiu, vei crea un array de frecvențe tf-idf pentru o colecție simplă de documente. Vei folosi TfidfVectorizer din sklearn, care transformă o listă de documente într-un array de frecvențe ale cuvintelor, returnat sub forma unui csr_matrix. Are metode fit() și transform(), ca orice alt obiect sklearn.

Îți este furnizată lista documents, care conține câteva documente simple despre animale de companie.

Acest exercițiu face parte din cursul

Învățare nesupervizată în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă TfidfVectorizer din sklearn.feature_extraction.text.
  • Creează o instanță TfidfVectorizer numită tfidf.
  • Aplică metoda .fit_transform() a lui tfidf pe documents și atribuie rezultatul variabilei csr_mat. Aceasta este reprezentarea frecvențelor cuvintelor în format csr_matrix.
  • Inspectează csr_mat apelând metoda sa .toarray() și afișând rezultatul. Acest pas a fost deja realizat pentru tine.
  • Coloanele array-ului corespund cuvintelor. Obține lista de cuvinte apelând metoda .get_feature_names_out() a lui tfidf și atribuie rezultatul variabilei words.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import TfidfVectorizer
from ____ import ____

# Create a TfidfVectorizer: tfidf
tfidf = ____ 

# Apply fit_transform to document: csr_mat
csr_mat = ____

# Print result of toarray() method
print(csr_mat.toarray())

# Get the words: words
words = ____

# Print words
print(words)
Editează și rulează codul