Pole četností slov pomocí tf-idf
V tomto cvičení vytvoříš pole četností slov metodou tf-idf pro ukázkovou kolekci dokumentů. Použij k tomu TfidfVectorizer ze sklearn. Ten transformuje seznam dokumentů na pole četností slov, které vrátí jako csr_matrix. Stejně jako ostatní objekty sklearn má metody fit() a transform().
Máš k dispozici seznam documents s ukázkovými dokumenty o domácích zvířatech.
Toto cvičení je součástí kurzu
Unsupervised Learning in Python
Pokyny k cvičení
- Importuj
TfidfVectorizerzsklearn.feature_extraction.text. - Vytvoř instanci
TfidfVectorizera pojmenuj jitfidf. - Aplikuj metodu
.fit_transform()objektutfidfnadocumentsa výsledek ulož docsr_mat. Jde o pole četností slov ve formátu csr_matrix. - Prozkoumej
csr_matzavoláním metody.toarray()a výsledek vypiš. Tento krok je už za tebe hotový. - Sloupce pole odpovídají jednotlivým slovům. Získej seznam slov zavoláním metody
.get_feature_names_out()objektutfidfa výsledek ulož dowords.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import TfidfVectorizer
from ____ import ____
# Create a TfidfVectorizer: tfidf
tfidf = ____
# Apply fit_transform to document: csr_mat
csr_mat = ____
# Print result of toarray() method
print(csr_mat.toarray())
# Get the words: words
words = ____
# Print words
print(words)