开始使用免费开始使用

将 TF-IDF 应用于图书简介

PyBooks 已收集多条图书简介,想用 TF-IDF 编码技术识别其中的重要词语。通过这样做,他们希望更深入地了解每本书的独特属性,从而改进图书推荐系统。

以下软件包已为您导入:torchtorchtext

本练习是课程的一部分

使用 PyTorch 的文本深度学习

查看课程

练习说明

  • sklearn.feature_extraction.text 导入 TfidfVectorizer 类,用于将一组原始文档转换为 TF-IDF 特征矩阵。
  • 实例化该类的对象,然后使用该对象将 descriptions 编码为由向量组成的 TF-IDF 矩阵。
  • vectorizertfidf_encoded_descriptions 中分别获取并显示前 5 个特征名称和已编码向量。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)

# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])
编辑并运行代码