开始使用免费开始使用

电影评论的 BoW 向量

在本练习中,您会拿到两个 pandas Series:X_trainX_test,其中包含电影评论。它们分别代表训练集和测试集的评论数据。您的任务是对评论进行预处理,并使用 CountVectorizer 为这两组数据生成 BoW 向量。

一旦我们生成了 BoW 向量矩阵 X_train_bowX_test_bow,就可以很好地为其应用机器学习模型并开展情感分析。

本练习是课程的一部分

Python 中的 NLP 特征工程

查看课程

练习说明

  • sklearn 库中导入 CountVectorizer
  • 实例化名为 vectorizerCountVectorizer 对象。确保将所有单词转换为小写,并移除 english 停用词。
  • 使用 X_train 拟合 vectorizer,然后用它转换 X_train 以生成一组 BoW 向量 X_train_bow
  • 使用 vectorizer 转换 X_test,以生成一组 BoW 向量 X_test_bow

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)

# Fit and transform X_train
X_train_bow = vectorizer.____(____)

# Transform X_test
X_test_bow = vectorizer.____(____)

# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)
编辑并运行代码