CommencezCommencez gratuitement

Imputation avec des forêts aléatoires

Une approche de Machine Learning pour l'imputation peut être à la fois plus précise et plus simple à mettre en œuvre que les modèles statistiques traditionnels. D'abord, elle ne vous oblige pas à préciser les relations entre les variables. De plus, des modèles de Machine Learning comme les forêts aléatoires sont capables de découvrir des relations très complexes et non linéaires, puis de les exploiter pour prédire les valeurs manquantes.

Dans cet exercice, vous allez vous familiariser avec le paquet missForest, qui construit une forêt aléatoire distincte pour prédire les valeurs manquantes de chaque variable, une à une. Vous appellerez la fonction d'imputation sur les données de films biographiques, biopics, que vous avez déjà utilisées plus tôt dans le cours, puis vous extrayerez autant les données complétées que les erreurs d'imputation estimées.

Faisons pousser quelques forêts aléatoires !

Cette activité fait partie du cours

Traitement des données manquantes par imputation dans R

Voir le cours

Instructions de l’exercice

  • Chargez le paquet missForest.
  • Utilisez missForest() pour imputer les valeurs manquantes dans les données biopics; assignez le résultat à imp_res.
  • Extrayez l'ensemble de données imputé de imp_res, assignez-le à imp_data, puis vérifiez que le nombre de valeurs manquantes est bien de zéro.
  • Extrayez l'erreur d'imputation estimée de imp_res, assignez-la à imp_err, puis affichez-la dans la console.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load the missForest package
___

# Impute biopics data using missForest
imp_res <- ___(___)

# Extract imputed data and check for missing values
imp_data <- imp_res$___
print(___(___(___)))

# Extract and print imputation errors
imp_err <- imp_res$___
print(___)
Modifier et exécuter le code