电影剧情的 TF-IDF
我们将使用随机选取的电影剧情来进行文档聚类。在对文档进行聚类之前,需要先清理不需要的噪声(如特殊字符和停用词),并通过对文档进行 TF-IDF 转换为稀疏矩阵。
使用 TfidfVectorizer 类对存放在列表 plots 中的电影剧情执行 TF-IDF。remove_noise() 函数可作为 TfidfVectorizer 类中的 tokenizer 使用。.fit_transform() 方法会先将数据拟合到 TfidfVectorizer 对象中,然后生成 TF-IDF 稀疏矩阵。
注意:运行 .fit_transform() 方法需要几秒钟。
本练习是课程的一部分
Python 中的聚类分析
练习说明
- 从
sklearn导入TfidfVectorizer类。 - 使用最小和最大频率分别为 0.1 和 0.75,且最大特征数为 50 来初始化
TfidfVectorizer类。 - 在已初始化的
TfidfVectorizer上对列表 plots 调用fit_transform()方法。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)
# Use the .fit_transform() method on the list plots
tfidf_matrix = ____