维度与预处理分析
在本练习中,已为您提供 lem_corpus,其中包含上一个练习中电影标语的预处理版本。也就是说,这些标语已经转换为小写并进行了词形还原,同时移除了停用词。
您的任务是为这些词形还原后的标语生成词袋表示 bow_lem_matrix,并将其形状与上一个练习得到的 bow_matrix 进行比较。控制台中已打印 lem_corpus 的前 5 条词形还原后的标语,方便您查看。
本练习是课程的一部分
Python 中的 NLP 特征工程
练习说明
- 从
sklearn导入CountVectorizer类。 - 实例化一个
CountVectorizer对象,并命名为vectorizer。 - 使用
fit_transform()为lem_corpus生成bow_lem_matrix。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)
# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)