Trouver le seuil optimal
Imaginez que vous menez une campagne pour éviter que des clients ne fassent défaut. Vous pouvez planifier votre campagne à l'aide de vos prédictions. Le choix du seuil est donc essentiel pour vos résultats. Si vous connaissez les coûts et les gains de votre campagne, vous pouvez vérifier empiriquement quel seuil est le plus pertinent. Dans cet exercice, nous sommes face au scénario suivant :
Si un client ne fait pas défaut grâce à notre campagne, c'est-à-dire si nous avons correctement prédit le défaut (vrai positif), nous obtenons un gain de 1000 €. En revanche, si nous ciblons un client qui n'aurait de toute façon pas fait défaut, c'est-à-dire si nous avons prédit à tort que le client ferait défaut (faux positif), nous subissons un coût de 250 €.
D'après l'exercice précédent, nous savons que le modèle restreint était le meilleur. Calculez donc uniquement le seuil optimal pour ce modèle. Les prédictions sont stockées dans la colonne predNew du dataframe defaultData. Utilisez le paquet SDMTools.
Cette activité fait partie du cours
Machine Learning for Marketing Analytics in R
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
library(SDMTools)
# Confusion matrix with threshold 0.5
confMat <- confusion.matrix(defaultData$PaymentDefault,
defaultData$predNew,
threshold = ___)
confMat