Usar clasificación de ML para detectar fraude
En este ejercicio verás qué ocurre cuando usas un modelo sencillo de Machine Learning con nuestros datos de tarjetas de crédito.
¿Crees que puedes superar esos resultados? Recuerda: has predicho 22 de 50 casos de fraude y tuviste 16 falsos positivos.
Con esto en mente, vamos a implementar un modelo de Regresión logística. Si has hecho la clase de aprendizaje supervisado en Python, este modelo te resultará familiar. Si no, quizá te interese repasarlo ahora. Pero no te preocupes: te guiaremos por la estructura del modelo de Machine Learning.
Las variables X y y están disponibles en tu espacio de trabajo.
Este ejercicio forma parte del curso
Fraud Detection in Python
Instrucciones del ejercicio
- Divide
Xeyen datos de entrenamiento y prueba, reservando el 30% para prueba. - Ajusta tu modelo con los datos de entrenamiento.
- Obtén las etiquetas predichas del modelo ejecutando
model.predictsobreX_test. - Obtén un informe de clasificación comparando
y_testconpredicted, y usa la matriz de confusión proporcionada para comprobar tus resultados.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Create the training and testing sets
X_train, X_test, y_train, y_test = train_test_split(____, ____, test_size=____, random_state=0)
# Fit a logistic regression model to our data
model = LogisticRegression()
model.fit(____, ____)
# Obtain model predictions
predicted = model.predict(____)
# Print the classifcation report and confusion matrix
print('Classification report:\n', classification_report(____, ____))
conf_mat = confusion_matrix(y_true=y_test, y_pred=predicted)
print('Confusion matrix:\n', conf_mat)