Ajustement en échantillon : modèle restreint
Vous avez calculé la précision pour logitModelFull. Il est très important de le faire pour tous vos modèles candidats.
Ainsi, logitModelNew est spécifié et présent dans votre environnement.
Lorsque vous comparez les valeurs des différents modèles entre eux : si plusieurs modèles ont la même précision, choisissez toujours celui qui comporte le moins de variables explicatives.
Cet exercice fait partie du cours
<cours>Machine Learning for Marketing Analytics in R</cours>Instructions de l’exercice
Reprenez les mêmes étapes que dans l'exercice précédent pour le nouveau modèle.
Utilisez
predict()pour obtenir, pour chaque client, la probabilité de défaut de paiement.Calculez ensuite une matrice de confusion avec le même seuil de 0,5 pour la classification. Notez que
SDMToolsn'est plus téléchargeable depuis CRAN. Installez-le plutôt viaremotes::install_version("SDMTools", "1.1-221.2").Calculez la précision du modèle restreint et comparez-la à celle du modèle complet. Vous poursuivrez votre analyse uniquement avec le modèle le plus performant.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Calculate the accuracy for 'logitModelNew'
# Make prediction
defaultData$predNew <- predict(logitModelNew, type = ___, na.action = ___)
# Construct the in-sample confusion matrix
confMatrixModelNew <- confusion.matrix(defaultData$___,defaultData$___, threshold = ___)
confMatrixModelNew
# Calculate the accuracy...
accuracyNew <- sum(diag(___)) / ___(___)
accuracyNew
# and compare it to the full model's accuracy
accuracyFull