Fehlende Daten imputieren
Fehlende Daten kommen vor. Wenn wir annehmen, dass unsere Daten vollständig zufällig fehlen, unterstellen wir, dass die vorhandenen Daten die Grundgesamtheit gut repräsentieren. Haben wir nur wenige fehlende Werte, können wir sie entfernen oder den Mittelwert bzw. Median als Ersatz verwenden. In dieser Übung betrachten wir 'PDOM': Days on Market at Current Price.
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering mit PySpark</Kurs>Übungsanweisungen
- Ermittle die Anzahl der fehlenden Werte in der Spalte
'PDOM'mithilfe vonwhere(),isNull()undcount(). - Berechne den Mittelwert von
'PDOM'mit der Aggregatfunktionmean(). - Verwende
fillna()mit dem auf den'PDOM'-Mittelwert gesetzten Wert und wende es nur auf die Spalte'PDOM'an, indem du den Parametersubsetnutzt.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Count missing rows
missing = df.____(df[____].____()).____()
# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]
# Replacing with the mean value for that column
df.____(____, ____=[____])