tf-idf 词频数组
在本练习中,您将为一个示例文档集合创建一个 tf-idf 词频数组。请使用 sklearn 中的 TfidfVectorizer。它会将文档列表转换为词频数组,并以 csr_matrix 的形式输出。它与其他 sklearn 对象一样,具有 fit() 和 transform() 方法。
您将得到一个关于宠物的示例文档列表 documents。
本练习是课程的一部分
Python 中的无监督学习
练习说明
- 从
sklearn.feature_extraction.text导入TfidfVectorizer。 - 创建一个名为
tfidf的TfidfVectorizer实例。 - 将
tfidf的.fit_transform()方法应用到documents,并将结果赋给csr_mat。这是一个以 csr_matrix 格式表示的词频数组。 - 通过调用其
.toarray()方法并打印结果来查看csr_mat。此步骤已为您完成。 - 数组的列对应词语。通过调用
tfidf的.get_feature_names_out()方法获取词语列表,并将结果赋给words。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import TfidfVectorizer
from ____ import ____
# Create a TfidfVectorizer: tfidf
tfidf = ____
# Apply fit_transform to document: csr_mat
csr_mat = ____
# Print result of toarray() method
print(csr_mat.toarray())
# Get the words: words
words = ____
# Print words
print(words)