开始使用免费开始使用

步骤 3:构建分类器

这是情感分析预测的最后一步。我们已经基于情感相关特征对数据集进行了探索与增强,并将其转换为数值向量。

您将使用前面步骤中构建的数据集。具体来说,它包含一个评论长度特征,以及由 Tfidf 向量器创建的 200 个特征。

您的任务是训练一个逻辑回归模型来预测情感。数据已为您导入,名称为 reviews_transformed。目标变量名为 score,是二元的:当产品评论为正面时为 1,否则为 0

请训练一个逻辑回归模型,并在测试数据上评估其性能。模型效果如何?

所有所需的包都已为您导入。

本练习是课程的一部分

Python 中的情感分析

查看课程

练习说明

  • 进行训练/测试集划分,将 20% 的数据用于测试,并将随机种子设为 456
  • 训练一个逻辑回归模型。
  • 进行类别预测。
  • 打印测试集上的准确率和混淆矩阵。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Define X and y
y = reviews_transformed.score
X = reviews_transformed.drop('score', axis=1)

# Train/test split
X_train, X_test, y_train, y_test = ____(____, ____, ____=0.2, ____=456)

# Train a logistic regression
log_reg = ____.____(____, ____)
# Predict the labels
y_predicted = log_reg.____(____)

# Print accuracy score and confusion matrix on test set
print('Accuracy on the test set: ', ____(____, ____))
print(____(____, ____)/len(y_test))
编辑并运行代码