电影评论的 BoW 向量
在本练习中,您会拿到两个 pandas Series:X_train 和 X_test,其中包含电影评论。它们分别代表训练集和测试集的评论数据。您的任务是对评论进行预处理,并使用 CountVectorizer 为这两组数据生成 BoW 向量。
一旦我们生成了 BoW 向量矩阵 X_train_bow 和 X_test_bow,就可以很好地为其应用机器学习模型并开展情感分析。
本练习是课程的一部分
Python 中的 NLP 特征工程
练习说明
- 从
sklearn库中导入CountVectorizer。 - 实例化名为
vectorizer的CountVectorizer对象。确保将所有单词转换为小写,并移除english停用词。 - 使用
X_train拟合vectorizer,然后用它转换X_train以生成一组 BoW 向量X_train_bow。 - 使用
vectorizer转换X_test,以生成一组 BoW 向量X_test_bow。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)
# Fit and transform X_train
X_train_bow = vectorizer.____(____)
# Transform X_test
X_test_bow = vectorizer.____(____)
# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)