含 n-gram 与词汇量限制的 BOW
在本练习中,您将再次练习构建词袋模型,使用 Amazon 产品评论的 reviews 数据集。您的主要任务是限制词汇表的大小,并指定 token 序列的长度。
本练习是课程的一部分
Python 中的情感分析
练习说明
- 从
sklearn导入向量器。 - 构建向量器,并确保设置以下参数:将词汇表大小限制为 1000,只包含二元组(bigram),且忽略在超过 500 篇文档中出现的术语。
- 将向量器拟合到
review列。 - 基于 BOW 表示创建一个 DataFrame。
交互式实操练习
通过完成这段示例代码来试试这个练习。
#Import the vectorizer
from sklearn.____.____ import ____
# Build the vectorizer, specify max features and fit
vect = ____(____=1000, ____=(2, 2), ____=500)
vect.____(reviews.review)
# Transform the review
X_review = vect.transform(reviews.review)
# Create a DataFrame from the bow representation
X_df = pd.DataFrame(X_review.____, columns=____._____)
print(X_df.head())