Dummy-Werte auffüllen
Ähnlich wie du zuvor nach Zusammenhängen von fehlenden zu fehlenden Werten zwischen Spalten gesucht hast, ist es auch wichtig, Beziehungen von fehlenden zu nicht fehlenden Werten zwischen Spalten zu prüfen. So erkennst du mögliche Faktoren für Missingness in den Daten.
In der obigen Abbildung siehst du, dass sich die fehlenden Werte von Serum Insulin über den gesamten Bereich der BMI-Werte verteilen. Das bedeutet schlicht: Es gibt keinen Zusammenhang!
In dieser Übung wirst du eine Funktion schreiben, die Dummy-Werte erzeugt, um das oben gezeigte Streudiagramm (in der nächsten Übung) zu erstellen. Beim Erzeugen der Dummy-Werte werden Zufallswerte mit einem Skalierungsfaktor in den Bereich einer Spalte skaliert und anschließend verschoben.
Die Funktion rand() wurde für dich aus numpy.random importiert.
Diese Übung ist Teil des Kurses
<Kurs>Umgang mit fehlenden Daten in Python</Kurs>Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
def fill_dummy_values(df):
df_dummy = df.copy(deep=True)
for col_name in df_dummy:
col = df_dummy[col_name]
# Calculate column range
col_range = ___ - ___
return df_dummy