Analyser le sommaire du modèle linéaire
L'analyse de la performance des différents modèles imputés est l'une des tâches les plus importantes lorsqu'on traite les données manquantes. Elle détermine sur quel type de DataFrame imputé vous pouvez vous fier. Pour l'analyse, vous pouvez ajuster un modèle de régression linéaire sur le DataFrame imputé et examiner divers paramètres qui influencent le choix du type d'imputation.
Dans cet exercice, le DataFrame diabetes_cc a déjà été chargé. Il s'agit du jeu de données « cas complets » pour le diabète. Le cas complet sert de référence pour comparer les autres DataFrames imputés. Vous utiliserez le module statsmodels.api importé sous sm pour créer un modèle de régression linéaire et générer des sommaires.
Cette activité fait partie du cours
Gérer les données manquantes avec Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Add constant to X and set X & y values to fit linear model
X = sm.add_constant(___)
y = ___
lm = sm.OLS(y, X).fit()