Ontbrekende data imputeren
Ontbrekende data komt voor. Als we aannemen dat onze data volledig willekeurig ontbreekt, gaan we ervan uit dat de data die we wél hebben een goede afspiegeling is van de populatie. Als we maar een paar ontbrekende waarden hebben, kunnen we ze verwijderen of vervangen door het gemiddelde of de mediaan. In deze oefening bekijken we 'PDOM': Days on Market at Current Price.
Deze oefening maakt deel uit van de cursus
Feature Engineering met PySpark
Oefeninstructies
- Tel het aantal ontbrekende waarden in de kolom
'PDOM'metwhere(),isNull()encount(). - Bereken de gemiddelde waarde van
'PDOM'met de aggregatiefunctiemean(). - Gebruik
fillna()met de waarde ingesteld op het gemiddelde van'PDOM'en pas dit alleen toe op de kolom'PDOM'via de parametersubset.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Count missing rows
missing = df.____(df[____].____()).____()
# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]
# Replacing with the mean value for that column
df.____(____, ____=[____])