En tf-idf-ordfrekvensmatris
I den här övningen skapar du en tf-idf-ordfrekvensmatris för en liten samling dokument. Använd TfidfVectorizer från sklearn, som omvandlar en lista med dokument till en ordfrekvensmatris och returnerar resultatet som en csr_matrix. Precis som andra sklearn-objekt har det metoderna fit() och transform().
Du får en lista documents med enkla dokument om husdjur.
Den här övningen är en del av kursen
Oövervakad inlärning i Python
Övningsinstruktioner
- Importera
TfidfVectorizerfrånsklearn.feature_extraction.text. - Skapa en instans av
TfidfVectorizeroch kalla dentfidf. - Anropa metoden
.fit_transform()påtfidfmeddocumentssom argument och tilldela resultatet tillcsr_mat. Det här är en ordfrekvensmatris i csr_matrix-format. - Granska
csr_matgenom att anropa dess.toarray()-metod och skriva ut resultatet. Det här har redan gjorts åt dig. - Kolumnerna i matrisen motsvarar ord. Hämta listan med ord genom att anropa metoden
.get_feature_names_out()påtfidfoch tilldela resultatet tillwords.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import TfidfVectorizer
from ____ import ____
# Create a TfidfVectorizer: tfidf
tfidf = ____
# Apply fit_transform to document: csr_mat
csr_mat = ____
# Print result of toarray() method
print(csr_mat.toarray())
# Get the words: words
words = ____
# Print words
print(words)