LoslegenKostenlos starten

Fehlende Daten imputieren

Fehlende Daten kommen vor. Wenn wir annehmen, dass unsere Daten vollständig zufällig fehlen, unterstellen wir, dass die vorhandenen Daten die Grundgesamtheit gut repräsentieren. Haben wir nur wenige fehlende Werte, können wir sie entfernen oder den Mittelwert bzw. Median als Ersatz verwenden. In dieser Übung betrachten wir 'PDOM': Days on Market at Current Price.

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering mit PySpark</Kurs>
Kurs ansehen

Übungsanweisungen

  • Ermittle die Anzahl der fehlenden Werte in der Spalte 'PDOM' mithilfe von where(), isNull() und count().
  • Berechne den Mittelwert von 'PDOM' mit der Aggregatfunktion mean().
  • Verwende fillna() mit dem auf den 'PDOM'-Mittelwert gesetzten Wert und wende es nur auf die Spalte 'PDOM' an, indem du den Parameter subset nutzt.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Count missing rows
missing = df.____(df[____].____()).____()

# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]

# Replacing with the mean value for that column
df.____(____, ____=[____])
Code bearbeiten und ausführen