开始使用免费开始使用

电影标语的 BoW 模型

在本练习中,已为您提供了一个包含超过 7000 条电影标语的 corpus。您的任务是为这些标语生成词袋表示 bow_matrix。本练习中我们将忽略文本预处理步骤,直接生成 bow_matrix

我们还将查看生成的 bow_matrix 的形状。corpus 中前 5 条标语已打印到控制台,供您查看。

本练习是课程的一部分

Python 中的 NLP 特征工程

查看课程

练习说明

  • sklearn 导入 CountVectorizer 类。
  • 实例化一个 CountVectorizer 对象,命名为 vectorizer
  • 使用 fit_transform(),为 corpus 生成 bow_matrix

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)

# Print the shape of bow_matrix
print(bow_matrix.shape)
编辑并运行代码