开始使用免费开始使用

步骤 2:构建向量化器

在本练习中,您需要对 reviews 数据集中的 review 列进行 TfIDf 转换。您需要指定 n-gram、停用词、分词模式以及词汇表大小等参数。

这是在训练分类器以预测评论情感之前的最后一步。

请务必正确设置最大特征数。词汇表过大可能会导致会话断开。

本练习是课程的一部分

Python 中的情感分析

查看课程

练习说明

  • 导入 Tfidf 向量化器和英语停用词的默认列表。
  • 构建 Tfidf 向量化器,并按此顺序指定以下参数:将默认英语停用词列表作为停用词;n-gram 使用 uni-gram 和 bi-gram;最大特征数为 200;仅使用给定模式匹配单词。
  • 使用该 Tfidf 向量化器创建一个 DataFrame。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import the TfidfVectorizer and default list of English stop words
from sklearn.feature_extraction.text import ____, ____

# Build the vectorizer
vect = ____(____=____, ____=(1, 2), ____=200, ____=r'\b[^\d\W][^\d\W]+\b').fit(reviews.review)
# Create sparse matrix from the vectorizer
X = vect.transform(reviews.review)

# Create a DataFrame
reviews_transformed = pd.DataFrame(X.____, columns=vect.____)
print('Top 5 rows of the DataFrame: \n', reviews_transformed.head())
编辑并运行代码