用 BOW 指定标记序列长度
我们在视频中看到,通过指定不同长度的标记(即 n-gram),可以更好地捕捉上下文,这往往非常重要。
在本练习中,您将使用一部分 Amazon 商品评论。您的任务是使用 review 列构建一个 BOW 词汇表,并指定标记序列的长度。
本练习是课程的一部分
Python 中的情感分析
练习说明
- 构建向量化器,将标记序列长度指定为 uni-gram 和 bi-gram。
- 拟合向量化器。
- 使用已拟合的向量化器进行转换。
- 在 DataFrame 中,请确保正确指定列名。
交互式实操练习
通过完成这段示例代码来试试这个练习。
from sklearn.feature_extraction.text import CountVectorizer
# Build the vectorizer, specify token sequence and fit
vect = ____(____=(___,___))
vect.____(reviews.review)
# Transform the review column
X_review = vect.____(reviews.review)
# Create the bow representation
X_df = pd.DataFrame(X_review.toarray(), columns=vect.____)
print(X_df.head())