Kom igångKom igång gratis

En tf-idf-ordfrekvensmatris

I den här övningen skapar du en tf-idf-ordfrekvensmatris för en liten samling dokument. Använd TfidfVectorizer från sklearn, som omvandlar en lista med dokument till en ordfrekvensmatris och returnerar resultatet som en csr_matrix. Precis som andra sklearn-objekt har det metoderna fit() och transform().

Du får en lista documents med enkla dokument om husdjur.

Den här övningen är en del av kursen

Oövervakad inlärning i Python

Visa kurs

Övningsinstruktioner

  • Importera TfidfVectorizer från sklearn.feature_extraction.text.
  • Skapa en instans av TfidfVectorizer och kalla den tfidf.
  • Anropa metoden .fit_transform()tfidf med documents som argument och tilldela resultatet till csr_mat. Det här är en ordfrekvensmatris i csr_matrix-format.
  • Granska csr_mat genom att anropa dess .toarray()-metod och skriva ut resultatet. Det här har redan gjorts åt dig.
  • Kolumnerna i matrisen motsvarar ord. Hämta listan med ord genom att anropa metoden .get_feature_names_out()tfidf och tilldela resultatet till words.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import TfidfVectorizer
from ____ import ____

# Create a TfidfVectorizer: tfidf
tfidf = ____ 

# Apply fit_transform to document: csr_mat
csr_mat = ____

# Print result of toarray() method
print(csr_mat.toarray())

# Get the words: words
words = ____

# Print words
print(words)
Redigera och kör kod