Un tableau de fréquences de mots tf-idf
Dans cet exercice, vous allez créer un tableau de fréquences de mots tf-idf pour une petite collection de documents. Pour cela, utilisez TfidfVectorizer de sklearn. Cet outil transforme une liste de documents en un tableau de fréquences de mots, qu'il retourne sous forme de csr_matrix. Comme d'autres objets sklearn, il possède les méthodes fit() et transform().
On vous fournit une liste documents de courts documents sur des animaux de compagnie.
Cette activité fait partie du cours
Unsupervised Learning in Python
Instructions de l’exercice
- Importez
TfidfVectorizerdepuissklearn.feature_extraction.text. - Créez une instance de
TfidfVectorizerappeléetfidf. - Appliquez la méthode
.fit_transform()detfidfàdocumentset assignez le résultat àcsr_mat. Il s'agit d'un tableau de fréquences de mots au format csr_matrix. - Inspectez
csr_maten appelant sa méthode.toarray()et en imprimant le résultat. Cela a été fait pour vous. - Les colonnes du tableau correspondent aux mots. Obtenez la liste des mots en appelant la méthode
.get_feature_names_out()detfidf, et assignez le résultat àwords.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import TfidfVectorizer
from ____ import ____
# Create a TfidfVectorizer: tfidf
tfidf = ____
# Apply fit_transform to document: csr_mat
csr_mat = ____
# Print result of toarray() method
print(csr_mat.toarray())
# Get the words: words
words = ____
# Print words
print(words)