开始使用免费开始使用

Twitter 数据的性能指标

您将训练一个逻辑回归模型来预测推文的情感,并使用不同的指标在测试集上评估其性能。

已为您创建矩阵 X。它包含在 text 列上用 BOW(词袋)生成的特征。

标签存储在名为 y 的向量中。向量 y 的取值:负向推文为 0,中性为 1,正向为 2。 请注意,尽管有 3 个类别,这仍然是一个分类问题。准确率依然衡量正确预测实例所占的比例。混淆矩阵现在将是 3x3 的大小,每一行给出对类别 2、1、0 的预测个数,每一列给出类别 2、1、0 的真实个数。

所有必需的包已为您导入。

本练习是课程的一部分

Python 中的情感分析

查看课程

练习说明

  • 进行训练/测试集划分,并按 y 分层。
  • 训练一个逻辑回归分类器。
  • 在测试集上进行预测并评估性能。
  • 打印测试集上的准确率和混淆矩阵。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Split the data into training and testing sets
X_train, X_test, y_train, y_test = ____(X, y, test_size=0.3, random_state=123, ____=y)

# Train a logistic regression
log_reg = ____.____(___, ____)

# Make predictions on the test set
y_predicted = log_reg.____(___)

# Print the performance metrics
print('Accuracy score test set: ', ____(y_test, y_predicted))
print('Confusion matrix test set: \n', ____(y_test, y_predicted)/len(y_test))
编辑并运行代码