开始使用免费开始使用

实例化 TF-IDF 模型

默认情况下,TF-IDF 会为所有文档(本例中为电影梗概)中的每个词生成一个列。 这会产生一个规模庞大且不直观的数据集,因为其中既包含几乎每个文档都会出现的高频词,也包含极少出现、对衡量物品相似度没有价值的稀有词。

在本练习中,您将使用 df_plots DataFrame。它在 Title 列中包含电影名称,在 Plot 列中包含对应梗概。

基于该 DataFrame,您将先生成默认的 TF-IDF 分数,并查看是否存在没有价值的列。

接着,您将重新运行 TF-IDF 计算,这次通过设置 min_dfmax_df 参数来限制列的数量,并期望观察到改进。

本练习是课程的一部分

用 Python 构建推荐引擎

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

from sklearn.feature_extraction.text import TfidfVectorizer

# Instantiate the vectorizer object to the vectorizer variable
vectorizer = ____()

# Fit and transform the plot column
vectorized_data = vectorizer.____(df_plots['Plot'])

# Look at the features generated
print(____.____())
编辑并运行代码