构建并评估模型:电影评论
在本题中,您将使用 movies 数据集来构建一个逻辑回归模型。标签存储在 label 列中,评论为正面时为 1,负面时为 0。文本评论已使用 BOW 转换为数值特征列。
您之前已经构建过一个分类器,但用训练步骤所用的同一份数据进行了评估。现在请确保使用未见过的测试集来评估模型。将模型在测试集上评估后,性能有何变化?
本练习是课程的一部分
Python 中的情感分析
练习说明
- 导入用于进行训练/测试集划分的函数。
- 执行训练/测试集划分,指定 20% 的数据作为测试集。
- 训练一个逻辑回归模型。
- 分别打印模型在训练数据和测试数据上的准确率。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import the required packages
from sklearn.linear_model import LogisticRegression
____
# Define the vector of labels and matrix of features
y = movies.label
X = movies.drop('label', axis=1)
# Perform the train-test split
X_train, X_test, y_train, y_test = ____(X, y, ____=0.2, random_state=42)
# Build a logistic regression model and print out the accuracy
log_reg = ____.____
print('Accuracy on train set: ', log_reg.____(____, ____))
print('Accuracy on test set: ', log_reg.____(____, ____))