Aan de slagBegin gratis

Ontbrekende data visualiseren

Ontbrekende waarden plotten is een snelle manier om in te schatten hoeveel van je data ontbreekt. Het kan ook laten zien of variabelen volgens een bepaald patroon ontbreken — iets waar je zorgvuldig mee om moet gaan, anders kan je model bevooroordeeld raken.

Welke variabele heeft de meeste ontbrekende waarden? Voer alle codelijnen uit, behalve de laatste, om het antwoord te bepalen. Ben je zeker van je zaak? Vul dan de waarde in en klik op "Antwoord verzenden".

Deze oefening maakt deel uit van de cursus

Feature Engineering met PySpark

Bekijk cursus

Oefeninstructies

  • Gebruik select() om de dataframe df te subselecteren met de lijst kolommen columns en neem een steekproef met de meegeleverde functie sample(). Ken deze dataframe toe aan de variabele sample_df.
  • Zet de subset-dataframe om naar een pandas-dataframe pandas_df en gebruik pandas isnull() om deze DataFrame om te zetten naar True/False. Sla dit resultaat op in tf_df.
  • Gebruik de heatmap() van seaborn om tf_df te plotten.
  • Klik op "Code uitvoeren" om de plot te bekijken. Wijs daarna de naam van de variabele met de meeste ontbrekende waarden toe aan answer.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Sample the dataframe and convert to Pandas
____ = df.select(____).sample(False, 0.1, 42)
____ = ____.toPandas()

# Convert all values to T/F
tf_df = ____.____()

# Plot it
sns.____(data=____)
plt.xticks(rotation=30, fontsize=10)
plt.yticks(rotation=0, fontsize=10)
plt.show()

# Set the answer to the column with the most missing data
answer = '____'
Code bewerken en uitvoeren