开始使用免费开始使用

维度与预处理分析

在本练习中,已为您提供 lem_corpus,其中包含上一个练习中电影标语的预处理版本。也就是说,这些标语已经转换为小写并进行了词形还原,同时移除了停用词。

您的任务是为这些词形还原后的标语生成词袋表示 bow_lem_matrix,并将其形状与上一个练习得到的 bow_matrix 进行比较。控制台中已打印 lem_corpus 的前 5 条词形还原后的标语,方便您查看。

本练习是课程的一部分

Python 中的 NLP 特征工程

查看课程

练习说明

  • sklearn 导入 CountVectorizer 类。
  • 实例化一个 CountVectorizer 对象,并命名为 vectorizer
  • 使用 fit_transform()lem_corpus 生成 bow_lem_matrix

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)

# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)
编辑并运行代码