开始使用免费开始使用

含 n-gram 与词汇量限制的 BOW

在本练习中,您将再次练习构建词袋模型,使用 Amazon 产品评论的 reviews 数据集。您的主要任务是限制词汇表的大小,并指定 token 序列的长度。

本练习是课程的一部分

Python 中的情感分析

查看课程

练习说明

  • sklearn 导入向量器。
  • 构建向量器,并确保设置以下参数:将词汇表大小限制为 1000,只包含二元组(bigram),且忽略在超过 500 篇文档中出现的术语。
  • 将向量器拟合到 review 列。
  • 基于 BOW 表示创建一个 DataFrame。

交互式实操练习

通过完成这段示例代码来试试这个练习。

#Import the vectorizer
from sklearn.____.____ import ____

# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)

# Transform the review
X_review = vect.transform(reviews.review)

# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())
编辑并运行代码