ПочатиПочніть безкоштовно

Обчисліть частку пропусків

Автоматизація — це майбутнє науки про дані. Уміння автоматизувати частину підготовки даних дає відчутну віддачу. У цій вправі ми автоматизуємо видалення стовпців, якщо частка пропущених значень у них перевищує заданий поріг.

Ця вправа є частиною курсу

Опрацювання ознак у PySpark

Переглянути курс

Інструкції до вправи

  • Створіть функцію column_dropper(), яка приймає параметри: df — датафрейм і threshold — число з плаваючою крапкою між 0 та 1.
  • Обчисліть відсоток відсутніх значень за допомогою where(), isNull() і count()
  • Перевірте, чи частка пропусків вища за поріг; якщо так, видаліть стовпець за допомогою drop()
  • Запустіть column_dropper() на df із порогом, встановленим на .6

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

def column_dropper(df, threshold):
  # Takes a dataframe and threshold for missing values. Returns a dataframe.
  total_records = df.____()
  for col in df.columns:
    # Calculate the percentage of missing values
    missing = df.____(df[col].____()).____()
    missing_percent = ____ / ____
    # Drop column if percent of missing is more than threshold
    if ____ > ____:
      df = df.____(col)
  return df

# Drop columns that are more than 60% missing
df = ____(____, ____)
Редагувати та запускати код