Un array de frecvențe tf-idf
În acest exercițiu, vei crea un array de frecvențe tf-idf pentru o colecție simplă de documente. Vei folosi TfidfVectorizer din sklearn, care transformă o listă de documente într-un array de frecvențe ale cuvintelor, returnat sub forma unui csr_matrix. Are metode fit() și transform(), ca orice alt obiect sklearn.
Îți este furnizată lista documents, care conține câteva documente simple despre animale de companie.
Acest exercițiu face parte din cursul
Învățare nesupervizată în Python
Instrucțiuni pentru exercițiu
- Importă
TfidfVectorizerdinsklearn.feature_extraction.text. - Creează o instanță
TfidfVectorizernumitătfidf. - Aplică metoda
.fit_transform()a luitfidfpedocumentsși atribuie rezultatul variabileicsr_mat. Aceasta este reprezentarea frecvențelor cuvintelor în format csr_matrix. - Inspectează
csr_matapelând metoda sa.toarray()și afișând rezultatul. Acest pas a fost deja realizat pentru tine. - Coloanele array-ului corespund cuvintelor. Obține lista de cuvinte apelând metoda
.get_feature_names_out()a luitfidfși atribuie rezultatul variabileiwords.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import TfidfVectorizer
from ____ import ____
# Create a TfidfVectorizer: tfidf
tfidf = ____
# Apply fit_transform to document: csr_mat
csr_mat = ____
# Print result of toarray() method
print(csr_mat.toarray())
# Get the words: words
words = ____
# Print words
print(words)