使用机器学习分类来捕捉欺诈
在本练习中,您将看看在我们的信用卡数据上改用一个简单的机器学习模型会发生什么。
您觉得自己能超过之前的结果吗?回顾一下,您曾预测出 50 个欺诈案例中的 22 个,并产生了 16 个误报。
基于此,我们来实现一个 Logistic Regression 模型。若您上过 Python 监督学习课程,应该对这个模型很熟悉;如果没有,也可以在此时简单回顾。不过别担心,您将会在指导下完成这个机器学习模型的搭建。
工作区中已提供变量 X 和 y。
本练习是课程的一部分
Python 中的欺诈检测
练习说明
- 将
X和y划分为训练集和测试集,测试集占 30%。 - 在训练集上拟合模型。
- 对
X_test调用model.predict,获取模型预测标签。 - 将
y_test与predicted进行分类评估,并使用给定的混淆矩阵核对结果。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create the training and testing sets
X_train, X_test, y_train, y_test = train_test_split(____, ____, test_size=____, random_state=0)
# Fit a logistic regression model to our data
model = LogisticRegression()
model.fit(____, ____)
# Obtain model predictions
predicted = model.predict(____)
# Print the classifcation report and confusion matrix
print('Classification report:\n', classification_report(____, ____))
conf_mat = confusion_matrix(y_true=y_test, y_pred=predicted)
print('Confusion matrix:\n', conf_mat)