Imputation avec des forêts aléatoires
Une approche de Machine Learning pour l'imputation peut être à la fois plus précise et plus simple à mettre en œuvre que les modèles statistiques traditionnels. D'abord, elle ne vous oblige pas à préciser les relations entre les variables. De plus, des modèles de Machine Learning comme les forêts aléatoires sont capables de découvrir des relations très complexes et non linéaires, puis de les exploiter pour prédire les valeurs manquantes.
Dans cet exercice, vous allez vous familiariser avec le paquet missForest, qui construit une forêt aléatoire distincte pour prédire les valeurs manquantes de chaque variable, une à une. Vous appellerez la fonction d'imputation sur les données de films biographiques, biopics, que vous avez déjà utilisées plus tôt dans le cours, puis vous extrayerez autant les données complétées que les erreurs d'imputation estimées.
Faisons pousser quelques forêts aléatoires !
Cette activité fait partie du cours
Traitement des données manquantes par imputation dans R
Instructions de l’exercice
- Chargez le paquet
missForest. - Utilisez
missForest()pour imputer les valeurs manquantes dans les donnéesbiopics; assignez le résultat àimp_res. - Extrayez l'ensemble de données imputé de
imp_res, assignez-le àimp_data, puis vérifiez que le nombre de valeurs manquantes est bien de zéro. - Extrayez l'erreur d'imputation estimée de
imp_res, assignez-la àimp_err, puis affichez-la dans la console.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load the missForest package
___
# Impute biopics data using missForest
imp_res <- ___(___)
# Extract imputed data and check for missing values
imp_data <- imp_res$___
print(___(___(___)))
# Extract and print imputation errors
imp_err <- imp_res$___
print(___)