Beräkna andelen saknade värden
Automatisering är framtiden inom datavetenskap. Att lära sig automatisera delar av dataförberedelsen ger stor utdelning. I den här övningen automatiserar vi borttagning av kolumner som saknar data över ett visst tröskelvärde.
Den här övningen är en del av kursen
Feature Engineering med PySpark
Övningsinstruktioner
- Definiera en funktion
column_dropper()som tar parametrarnadf– en dataram – ochthreshold– ett flyttal mellan 0 och 1. - Beräkna andelen saknade värden med hjälp av
where(),isNull()ochcount() - Kontrollera om andelen saknade värden överstiger tröskelvärdet – i så fall tar du bort kolumnen med
drop() - Kör
column_dropper()pådfmed tröskelvärdet satt till .6
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
def column_dropper(df, threshold):
# Takes a dataframe and threshold for missing values. Returns a dataframe.
total_records = df.____()
for col in df.columns:
# Calculate the percentage of missing values
missing = df.____(df[col].____()).____()
missing_percent = ____ / ____
# Drop column if percent of missing is more than threshold
if ____ > ____:
df = df.____(col)
return df
# Drop columns that are more than 60% missing
df = ____(____, ____)