LoslegenKostenlos starten

Imputationen visualisieren

Imputationen zu analysieren und die beste auszuwählen, erfordert viel Experimentieren. Dabei ist es wichtig, darauf zu achten, dass deine Daten durch das Imputieren nicht verzerrt werden. In den letzten zwei Übungen hast du 4 verschiedene Imputationen erstellt: Mittelwert-, Median-, Modus- und Konstantwert-Imputation.

In dieser Übung erstellst du ein Streudiagramm der zuvor imputierten DataFrames. Dazu legst du ein Dictionary der DataFrames an, wobei die Schlüssel ihre Titel sind.

Die DataFrames diabetes_mean, diabetes_median, diabetes_mode und diabetes_constant wurden für dich geladen.

Diese Übung ist Teil des Kurses

<Kurs>Umgang mit fehlenden Daten in Python</Kurs>
Kurs ansehen

Übungsanweisungen

  • Erstelle 4 Subplots, indem du eine Grafik mit 2 Zeilen und 2 Spalten anlegst.
  • Erstelle das Dictionary imputations, indem du jeden Schlüssel seinem passenden DataFrame zuordnest.
  • Iteriere über axes und imputations und plotte jeden DataFrame in imputations.
  • Setze die Farbe auf die nullity und den Titel jedes Subplots auf den Namen der Imputation.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()

# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___, 
               'Most Frequent Imputation': ___, 'Constant Imputation': ___}

# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
    # Select and also set the title for a DataFrame
    imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter', 
                          alpha=0.5, c=___, cmap='rainbow', ax=ax, 
                          colorbar=False, title=___)
plt.show()
Code bearbeiten und ausführen