CommencezCommencez gratuitement

Visualiser les imputations

Analyser les imputations et choisir la meilleure demande beaucoup d'expérimentation. Il est important de vous assurer que vos données ne deviennent pas biaisées pendant l'imputation. Dans ces deux derniers exercices, vous avez créé 4 imputations différentes en utilisant la moyenne, la médiane, le mode et une valeur constante.

Dans cet exercice, vous allez créer un nuage de points pour les DataFrames que vous avez imputés précédemment. Pour y arriver, vous allez créer un dictionnaire des DataFrames dont les clés seront leurs titres.

Les DataFrames diabetes_mean, diabetes_median, diabetes_mode et diabetes_constant ont été chargés pour vous.

Cette activité fait partie du cours

Gérer les données manquantes avec Python

Voir le cours

Instructions de l’exercice

  • Créez 4 sous-graphiques en générant une figure avec 2 rangées et 2 colonnes.
  • Créez le dictionnaire imputations en associant chaque clé à son DataFrame correspondant.
  • Parcourez axes et imputations, et tracez chaque DataFrame dans imputations.
  • Définissez la couleur selon la nullity et le titre de chaque sous-graphe au nom de l'imputation.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()

# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___, 
               'Most Frequent Imputation': ___, 'Constant Imputation': ___}

# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
    # Select and also set the title for a DataFrame
    imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter', 
                          alpha=0.5, c=___, cmap='rainbow', ax=ax, 
                          colorbar=False, title=___)
plt.show()
Modifier et exécuter le code