Visualiser les imputations
Analyser les imputations et choisir la meilleure demande beaucoup d'expérimentation. Il est important de vous assurer que vos données ne deviennent pas biaisées pendant l'imputation. Dans ces deux derniers exercices, vous avez créé 4 imputations différentes en utilisant la moyenne, la médiane, le mode et une valeur constante.
Dans cet exercice, vous allez créer un nuage de points pour les DataFrames que vous avez imputés précédemment. Pour y arriver, vous allez créer un dictionnaire des DataFrames dont les clés seront leurs titres.
Les DataFrames diabetes_mean, diabetes_median, diabetes_mode et diabetes_constant ont été chargés pour vous.
Cette activité fait partie du cours
Gérer les données manquantes avec Python
Instructions de l’exercice
- Créez 4 sous-graphiques en générant une figure avec 2 rangées et 2 colonnes.
- Créez le dictionnaire
imputationsen associant chaque clé à son DataFrame correspondant. - Parcourez
axesetimputations, et tracez chaque DataFrame dansimputations. - Définissez la couleur selon la
nullityet le titre de chaque sous-graphe au nom de l'imputation.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()
# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___,
'Most Frequent Imputation': ___, 'Constant Imputation': ___}
# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
# Select and also set the title for a DataFrame
imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter',
alpha=0.5, c=___, cmap='rainbow', ax=ax,
colorbar=False, title=___)
plt.show()