开始使用免费开始使用

电影剧情的 TF-IDF

我们将使用随机选取的电影剧情来进行文档聚类。在对文档进行聚类之前,需要先清理不需要的噪声(如特殊字符和停用词),并通过对文档进行 TF-IDF 转换为稀疏矩阵。

使用 TfidfVectorizer 类对存放在列表 plots 中的电影剧情执行 TF-IDF。remove_noise() 函数可作为 TfidfVectorizer 类中的 tokenizer 使用。.fit_transform() 方法会先将数据拟合到 TfidfVectorizer 对象中,然后生成 TF-IDF 稀疏矩阵。

注意:运行 .fit_transform() 方法需要几秒钟。

本练习是课程的一部分

Python 中的聚类分析

查看课程

练习说明

  • sklearn 导入 TfidfVectorizer 类。
  • 使用最小和最大频率分别为 0.1 和 0.75,且最大特征数为 50 来初始化 TfidfVectorizer 类。
  • 在已初始化的 TfidfVectorizer 上对列表 plots 调用 fit_transform() 方法。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)

# Use the .fit_transform() method on the list plots
tfidf_matrix = ____
编辑并运行代码