Массив частот слов tf-idf
В этом упражнении вы создадите массив частот слов tf-idf для небольшой коллекции документов. Для этого используйте TfidfVectorizer из библиотеки sklearn. Он преобразует список документов в массив частот слов, который возвращается в формате csr_matrix. Как и другие объекты sklearn, он поддерживает методы fit() и transform().
Вам дан список documents, содержащий тестовые документы о домашних животных.
Это упражнение является частью курса
Обучение без учителя на Python
Инструкции к упражнению
- Импортируйте
TfidfVectorizerизsklearn.feature_extraction.text. - Создайте экземпляр
TfidfVectorizerс именемtfidf. - Примените метод
.fit_transform()объектаtfidfкdocumentsи сохраните результат в переменнуюcsr_mat. Это массив частот слов в формате csr_matrix. - Изучите содержимое
csr_mat, вызвав его метод.toarray()и выведя результат на экран. Этот шаг уже выполнен за вас. - Столбцы массива соответствуют словам. Получите список слов, вызвав метод
.get_feature_names_out()объектаtfidf, и сохраните результат в переменнуюwords.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import TfidfVectorizer
from ____ import ____
# Create a TfidfVectorizer: tfidf
tfidf = ____
# Apply fit_transform to document: csr_mat
csr_mat = ____
# Print result of toarray() method
print(csr_mat.toarray())
# Get the words: words
words = ____
# Print words
print(words)