Détecter la fraude avec une classification ML
Dans cet exercice, vous verrez ce qui se passe lorsqu'on applique un modèle simple de Machine Learning à nos données de cartes de crédit.
Pensez-vous pouvoir battre ces résultats ? Rappelons que vous avez prédit 22 cas de fraude sur 50 et obtenu 16 faux positifs.
Avec cela en tête, mettons en place un modèle de régression logistique. Si vous avez suivi le cours sur l'apprentissage supervisé en Python, vous devriez bien connaître ce modèle. Sinon, c'est un bon moment pour vous le remémorer. Ne vous en faites pas, vous serez guidé à travers la structure du modèle de Machine Learning.
Les variables X et y sont disponibles dans votre espace de travail.
Cette activité fait partie du cours
Détection de fraude en Python
Instructions de l’exercice
- Scindez
Xetyen ensembles d'entraînement et de test, en gardant 30 % des données pour le test. - Ajustez votre modèle sur vos données d'entraînement.
- Obtenez les étiquettes prédites du modèle en exécutant
model.predictsurX_test. - Produisez une classification en comparant
y_testàpredicted, puis utilisez la matrice de confusion fournie pour valider vos résultats.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create the training and testing sets
X_train, X_test, y_train, y_test = train_test_split(____, ____, test_size=____, random_state=0)
# Fit a logistic regression model to our data
model = LogisticRegression()
model.fit(____, ____)
# Obtain model predictions
predicted = model.predict(____)
# Print the classifcation report and confusion matrix
print('Classification report:\n', classification_report(____, ____))
conf_mat = confusion_matrix(y_true=y_test, y_pred=predicted)
print('Confusion matrix:\n', conf_mat)