Ontbrekende data visualiseren
Ontbrekende waarden plotten is een snelle manier om in te schatten hoeveel van je data ontbreekt. Het kan ook laten zien of variabelen volgens een bepaald patroon ontbreken — iets waar je zorgvuldig mee om moet gaan, anders kan je model bevooroordeeld raken.
Welke variabele heeft de meeste ontbrekende waarden? Voer alle codelijnen uit, behalve de laatste, om het antwoord te bepalen. Ben je zeker van je zaak? Vul dan de waarde in en klik op "Antwoord verzenden".
Deze oefening maakt deel uit van de cursus
Feature Engineering met PySpark
Oefeninstructies
- Gebruik
select()om de dataframedfte subselecteren met de lijst kolommencolumnsen neem een steekproef met de meegeleverde functiesample(). Ken deze dataframe toe aan de variabelesample_df. - Zet de subset-dataframe om naar een
pandas-dataframepandas_dfen gebruikpandasisnull()om dezeDataFrameom te zetten naar True/False. Sla dit resultaat op intf_df. - Gebruik de
heatmap()van seaborn omtf_dfte plotten. - Klik op "Code uitvoeren" om de plot te bekijken. Wijs daarna de naam van de variabele met de meeste ontbrekende waarden toe aan
answer.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Sample the dataframe and convert to Pandas
____ = df.select(____).sample(False, 0.1, 42)
____ = ____.toPandas()
# Convert all values to T/F
tf_df = ____.____()
# Plot it
sns.____(data=____)
plt.xticks(rotation=30, fontsize=10)
plt.yticks(rotation=0, fontsize=10)
plt.show()
# Set the answer to the column with the most missing data
answer = '____'