Aan de slagBegin gratis

Percentage missende waarden berekenen

Automatisering is de toekomst van data science. Als je een deel van je datavoorbereiding automatiseert, levert dat veel op. In deze oefening automatiseren we het droppen van kolommen als er meer ontbrekende data is dan een bepaalde drempelwaarde.

Deze oefening maakt deel uit van de cursus

Feature Engineering met PySpark

Bekijk cursus

Oefeninstructies

  • Definieer een functie column_dropper() die de parameters df (een dataframe) en threshold (een float tussen 0 en 1) accepteert.
  • Bereken het percentage ontbrekende waarden met where(), isNull() en count()
  • Controleer of het percentage ontbrekende waarden hoger is dan de drempel; zo ja, drop de kolom met drop()
  • Voer column_dropper() uit op df met de drempel ingesteld op .6

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

def column_dropper(df, threshold):
  # Takes a dataframe and threshold for missing values. Returns a dataframe.
  total_records = df.____()
  for col in df.columns:
    # Calculate the percentage of missing values
    missing = df.____(df[col].____()).____()
    missing_percent = ____ / ____
    # Drop column if percent of missing is more than threshold
    if ____ > ____:
      df = df.____(col)
  return df

# Drop columns that are more than 60% missing
df = ____(____, ____)
Code bewerken en uitvoeren