实例化 TF-IDF 模型
默认情况下,TF-IDF 会为所有文档(本例中为电影梗概)中的每个词生成一个列。 这会产生一个规模庞大且不直观的数据集,因为其中既包含几乎每个文档都会出现的高频词,也包含极少出现、对衡量物品相似度没有价值的稀有词。
在本练习中,您将使用 df_plots DataFrame。它在 Title 列中包含电影名称,在 Plot 列中包含对应梗概。
基于该 DataFrame,您将先生成默认的 TF-IDF 分数,并查看是否存在没有价值的列。
接着,您将重新运行 TF-IDF 计算,这次通过设置 min_df 和 max_df 参数来限制列的数量,并期望观察到改进。
本练习是课程的一部分
用 Python 构建推荐引擎
交互式实操练习
通过完成这段示例代码来试试这个练习。
from sklearn.feature_extraction.text import TfidfVectorizer
# Instantiate the vectorizer object to the vectorizer variable
vectorizer = ____()
# Fit and transform the plot column
vectorized_data = vectorizer.____(df_plots['Plot'])
# Look at the features generated
print(____.____())