开始使用免费开始使用

tf-idf 词频数组

在本练习中,您将为一个示例文档集合创建一个 tf-idf 词频数组。请使用 sklearn 中的 TfidfVectorizer。它会将文档列表转换为词频数组,并以 csr_matrix 的形式输出。它与其他 sklearn 对象一样,具有 fit()transform() 方法。

您将得到一个关于宠物的示例文档列表 documents

本练习是课程的一部分

Python 中的无监督学习

查看课程

练习说明

  • sklearn.feature_extraction.text 导入 TfidfVectorizer
  • 创建一个名为 tfidfTfidfVectorizer 实例。
  • tfidf.fit_transform() 方法应用到 documents,并将结果赋给 csr_mat。这是一个以 csr_matrix 格式表示的词频数组。
  • 通过调用其 .toarray() 方法并打印结果来查看 csr_mat。此步骤已为您完成。
  • 数组的列对应词语。通过调用 tfidf.get_feature_names_out() 方法获取词语列表,并将结果赋给 words

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import TfidfVectorizer
from ____ import ____

# Create a TfidfVectorizer: tfidf
tfidf = ____ 

# Apply fit_transform to document: csr_mat
csr_mat = ____

# Print result of toarray() method
print(csr_mat.toarray())

# Get the words: words
words = ____

# Print words
print(words)
编辑并运行代码