Aan de slagBegin gratis

Ontbrekende data imputeren

Ontbrekende data komt voor. Als we aannemen dat onze data volledig willekeurig ontbreekt, gaan we ervan uit dat de data die we wél hebben een goede afspiegeling is van de populatie. Als we maar een paar ontbrekende waarden hebben, kunnen we ze verwijderen of vervangen door het gemiddelde of de mediaan. In deze oefening bekijken we 'PDOM': Days on Market at Current Price.

Deze oefening maakt deel uit van de cursus

Feature Engineering met PySpark

Bekijk cursus

Oefeninstructies

  • Tel het aantal ontbrekende waarden in de kolom 'PDOM' met where(), isNull() en count().
  • Bereken de gemiddelde waarde van 'PDOM' met de aggregatiefunctie mean().
  • Gebruik fillna() met de waarde ingesteld op het gemiddelde van 'PDOM' en pas dit alleen toe op de kolom 'PDOM' via de parameter subset.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Count missing rows
missing = df.____(df[____].____()).____()

# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]

# Replacing with the mean value for that column
df.____(____, ____=[____])
Code bewerken en uitvoeren