Imputationen visualisieren
Imputationen zu analysieren und die beste auszuwählen, erfordert viel Experimentieren. Dabei ist es wichtig, darauf zu achten, dass deine Daten durch das Imputieren nicht verzerrt werden. In den letzten zwei Übungen hast du 4 verschiedene Imputationen erstellt: Mittelwert-, Median-, Modus- und Konstantwert-Imputation.
In dieser Übung erstellst du ein Streudiagramm der zuvor imputierten DataFrames. Dazu legst du ein Dictionary der DataFrames an, wobei die Schlüssel ihre Titel sind.
Die DataFrames diabetes_mean, diabetes_median, diabetes_mode und diabetes_constant wurden für dich geladen.
Diese Übung ist Teil des Kurses
<Kurs>Umgang mit fehlenden Daten in Python</Kurs>Übungsanweisungen
- Erstelle 4 Subplots, indem du eine Grafik mit 2 Zeilen und 2 Spalten anlegst.
- Erstelle das Dictionary
imputations, indem du jeden Schlüssel seinem passenden DataFrame zuordnest. - Iteriere über
axesundimputationsund plotte jeden DataFrame inimputations. - Setze die Farbe auf die
nullityund den Titel jedes Subplots auf den Namen der Imputation.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()
# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___,
'Most Frequent Imputation': ___, 'Constant Imputation': ___}
# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
# Select and also set the title for a DataFrame
imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter',
alpha=0.5, c=___, cmap='rainbow', ax=ax,
colorbar=False, title=___)
plt.show()