Масив частот слів tf-idf
У цій вправі ви створите масив частот слів tf-idf для невеликої колекції документів. Для цього скористайтеся TfidfVectorizer зі sklearn. Він перетворює список документів на масив частот слів і повертає його як csr_matrix. Обʼєкт має методи fit() і transform(), як і інші обʼєкти sklearn.
Вам надано список documents з прикладними документами про домашніх улюбленців.
Ця вправа є частиною курсу
Наглядове навчання в Python
Інструкції до вправи
- Імпортуйте
TfidfVectorizerзsklearn.feature_extraction.text. - Створіть екземпляр
TfidfVectorizerз назвоюtfidf. - Застосуйте метод
.fit_transform()обʼєктаtfidfдоdocumentsі запишіть результат уcsr_mat. Це масив частот слів у форматі csr_matrix. - Перегляньте
csr_mat, викликавши його метод.toarray()і вивівши результат. Це зроблено для вас. - Стовпці масиву відповідають словам. Отримайте список слів, викликавши метод
.get_feature_names_out()обʼєктаtfidf, і запишіть результат уwords.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import TfidfVectorizer
from ____ import ____
# Create a TfidfVectorizer: tfidf
tfidf = ____
# Apply fit_transform to document: csr_mat
csr_mat = ____
# Print result of toarray() method
print(csr_mat.toarray())
# Get the words: words
words = ____
# Print words
print(words)