电影标语的 BoW 模型
在本练习中,已为您提供了一个包含超过 7000 条电影标语的 corpus。您的任务是为这些标语生成词袋表示 bow_matrix。本练习中我们将忽略文本预处理步骤,直接生成 bow_matrix。
我们还将查看生成的 bow_matrix 的形状。corpus 中前 5 条标语已打印到控制台,供您查看。
本练习是课程的一部分
Python 中的 NLP 特征工程
练习说明
- 从
sklearn导入CountVectorizer类。 - 实例化一个
CountVectorizer对象,命名为vectorizer。 - 使用
fit_transform(),为corpus生成bow_matrix。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_matrix = vectorizer.____(____)
# Print the shape of bow_matrix
print(bow_matrix.shape)