开始使用免费开始使用

用商品评论构建 BOW

您已经在一个小数据集上练习了 BOW。现在,请将其应用到一组 Amazon 商品评论样本上。数据已为您导入,名称为 reviews。它包含两列:第一列为 score,当评论为负面时取 0,为正面时取 1;第二列为 review,包含顾客撰写的评论文本。您可以在 IPython Shell 中自由探索这些数据。

您的任务是使用 review 列来构建一个 BOW 词汇表。

请记住,可以在向量化器上调用 .get_feature_names() 方法来获得所有词汇元素的列表。

本练习是课程的一部分

Python 中的情感分析

查看课程

练习说明

  • 创建一个 CountVectorizer 对象,并指定最大特征数。
  • 拟合该向量化器。
  • 对已拟合的向量化器进行转换。
  • 创建一个 DataFrame,将稀疏矩阵转换为稠密数组,并确保正确指定列名。

交互式实操练习

通过完成这段示例代码来试试这个练习。

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify max features 
vect = ____(____=100)
# Fit the vectorizer
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df=pd.DataFrame(X_review._____, columns=___.____)
print(X_df.head())
编辑并运行代码