Percentage missende waarden berekenen
Automatisering is de toekomst van data science. Als je een deel van je datavoorbereiding automatiseert, levert dat veel op. In deze oefening automatiseren we het droppen van kolommen als er meer ontbrekende data is dan een bepaalde drempelwaarde.
Deze oefening maakt deel uit van de cursus
Feature Engineering met PySpark
Oefeninstructies
- Definieer een functie
column_dropper()die de parametersdf(een dataframe) enthreshold(een float tussen 0 en 1) accepteert. - Bereken het percentage ontbrekende waarden met
where(),isNull()encount() - Controleer of het percentage ontbrekende waarden hoger is dan de drempel; zo ja, drop de kolom met
drop() - Voer
column_dropper()uit opdfmet de drempel ingesteld op .6
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
def column_dropper(df, threshold):
# Takes a dataframe and threshold for missing values. Returns a dataframe.
total_records = df.____()
for col in df.columns:
# Calculate the percentage of missing values
missing = df.____(df[col].____()).____()
missing_percent = ____ / ____
# Drop column if percent of missing is more than threshold
if ____ > ____:
df = df.____(col)
return df
# Drop columns that are more than 60% missing
df = ____(____, ____)