用商品评论构建 BOW
您已经在一个小数据集上练习了 BOW。现在,请将其应用到一组 Amazon 商品评论样本上。数据已为您导入,名称为 reviews。它包含两列:第一列为 score,当评论为负面时取 0,为正面时取 1;第二列为 review,包含顾客撰写的评论文本。您可以在 IPython Shell 中自由探索这些数据。
您的任务是使用 review 列来构建一个 BOW 词汇表。
请记住,可以在向量化器上调用 .get_feature_names() 方法来获得所有词汇元素的列表。
本练习是课程的一部分
Python 中的情感分析
练习说明
- 创建一个 CountVectorizer 对象,并指定最大特征数。
- 拟合该向量化器。
- 对已拟合的向量化器进行转换。
- 创建一个 DataFrame,将稀疏矩阵转换为稠密数组,并确保正确指定列名。
交互式实操练习
通过完成这段示例代码来试试这个练习。
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify max features
vect = ____(____=100)
# Fit the vectorizer
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df=pd.DataFrame(X_review._____, columns=___.____)
print(X_df.head())