开始使用免费开始使用

用 BOW 指定标记序列长度

我们在视频中看到,通过指定不同长度的标记(即 n-gram),可以更好地捕捉上下文,这往往非常重要。

在本练习中,您将使用一部分 Amazon 商品评论。您的任务是使用 review 列构建一个 BOW 词汇表,并指定标记序列的长度。

本练习是课程的一部分

Python 中的情感分析

查看课程

练习说明

  • 构建向量化器,将标记序列长度指定为 uni-gram 和 bi-gram。
  • 拟合向量化器。
  • 使用已拟合的向量化器进行转换。
  • 在 DataFrame 中,请确保正确指定列名。

交互式实操练习

通过完成这段示例代码来试试这个练习。

from sklearn.feature_extraction.text import CountVectorizer 

# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)

# Transform the review column
X_review = vect.____(reviews.review)

# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())
编辑并运行代码