将 TF-IDF 应用于图书简介
PyBooks 已收集多条图书简介,想用 TF-IDF 编码技术识别其中的重要词语。通过这样做,他们希望更深入地了解每本书的独特属性,从而改进图书推荐系统。
以下软件包已为您导入:torch、torchtext。
本练习是课程的一部分
使用 PyTorch 的文本深度学习
练习说明
- 从
sklearn.feature_extraction.text导入TfidfVectorizer类,用于将一组原始文档转换为 TF-IDF 特征矩阵。 - 实例化该类的对象,然后使用该对象将
descriptions编码为由向量组成的 TF-IDF 矩阵。 - 从
vectorizer和tfidf_encoded_descriptions中分别获取并显示前 5 个特征名称和已编码向量。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)
# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])