Zacznij terazZacznij za darmo

Obliczanie procentu brakujących wartości

Automatyzacja to przyszłość data science. Warto nauczyć się automatyzować przygotowanie danych – to inwestycja, która szybko się zwraca. W tym ćwiczeniu zautomatyzujemy usuwanie kolumn, w których brakuje zbyt dużej części danych – powyżej określonego progu.

To ćwiczenie jest częścią kursu

Inżynieria cech z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Zdefiniuj funkcję column_dropper(), która przyjmuje parametry: df – ramkę danych oraz threshold – liczbę zmiennoprzecinkową z zakresu od 0 do 1.
  • Oblicz odsetek brakujących wartości, korzystając z where(), isNull() i count().
  • Sprawdź, czy odsetek brakujących wartości przekracza próg – jeśli tak, usuń kolumnę za pomocą drop().
  • Uruchom column_dropper() na df z progiem ustawionym na 0,6.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

def column_dropper(df, threshold):
  # Takes a dataframe and threshold for missing values. Returns a dataframe.
  total_records = df.____()
  for col in df.columns:
    # Calculate the percentage of missing values
    missing = df.____(df[col].____()).____()
    missing_percent = ____ / ____
    # Drop column if percent of missing is more than threshold
    if ____ > ____:
      df = df.____(col)
  return df

# Drop columns that are more than 60% missing
df = ____(____, ____)
Edytuj i uruchom kod