LoslegenKostenlos starten

Fehlenden-Prozentanteil berechnen

Automatisierung ist die Zukunft der Data Science. Wenn du Teile deiner Datenvorbereitung automatisierst, zahlt sich das aus. In dieser Übung automatisieren wir das Entfernen von Spalten, wenn ihnen über einem bestimmten Schwellenwert Daten fehlen.

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering mit PySpark</Kurs>
Kurs ansehen

Übungsanweisungen

  • Definiere eine Funktion column_dropper(), die die Parameter df (ein DataFrame) und threshold (ein Float zwischen 0 und 1) entgegennimmt.
  • Berechne den Prozentsatz fehlender Werte mit where(), isNull() und count().
  • Prüfe, ob der Prozentsatz der fehlenden Werte höher als der Schwellenwert ist; falls ja, entferne die Spalte mit drop().
  • Führe column_dropper() auf df mit einem Schwellenwert von 0.6 aus.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

def column_dropper(df, threshold):
  # Takes a dataframe and threshold for missing values. Returns a dataframe.
  total_records = df.____()
  for col in df.columns:
    # Calculate the percentage of missing values
    missing = df.____(df[col].____()).____()
    missing_percent = ____ / ____
    # Drop column if percent of missing is more than threshold
    if ____ > ____:
      df = df.____(col)
  return df

# Drop columns that are more than 60% missing
df = ____(____, ____)
Code bearbeiten und ausführen