CommencezCommencez gratuitement

Comparer l'imputation KNN et l'imputation par la médiane

Toutes les étapes de prétraitement dans la fonction train() sont effectuées sur l'ensemble d'entraînement de chaque pli de validation croisée. Ainsi, les mesures d'erreur rapportées tiennent compte des effets du prétraitement.

Cela inclut la méthode d'imputation utilisée (p. ex. knnImpute ou medianImpute). C'est utile, car cela vous permet de comparer différentes méthodes d'imputation et de choisir celle qui offre la meilleure performance hors échantillon.

median_model et knn_model sont disponibles dans votre espace de travail, de même que resamples, qui contient les résultats rééchantillonnés des deux modèles. Examinez les résultats des modèles en appelant

dotplot(resamples, metric = "ROC")

et choisissez celui qui fonctionne le mieux hors échantillon. Quelle méthode d'imputation donne le score ROC hors échantillon le plus élevé pour votre modèle glm ?

Cette activité fait partie du cours

Machine Learning avec caret en R

Voir le cours

Exercice interactif pratique

Passez de la théorie à l’action grâce à l’un de nos exercices interactifs

Commencer l’exercice