CommencezCommencez gratuitement

Calculer les pourcentages de valeurs manquantes

L'automatisation est l'avenir de la science des données. Apprendre à automatiser une partie de la préparation des données rapporte beaucoup. Dans cet exercice, nous allons automatiser la suppression de colonnes lorsque les données manquantes dépassent un seuil donné.

Cette activité fait partie du cours

Ingénierie des caractéristiques avec PySpark

Voir le cours

Instructions de l’exercice

  • Définissez une fonction column_dropper() qui prend en paramètres df, un dataframe, et threshold, un nombre à virgule entre 0 et 1.
  • Calculez le pourcentage de valeurs manquantes à l'aide de where(), isNull() et count()
  • Vérifiez si le pourcentage de valeurs manquantes est supérieur au seuil; si c'est le cas, supprimez la colonne avec drop()
  • Exécutez column_dropper() sur df avec un seuil de 0,6

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

def column_dropper(df, threshold):
  # Takes a dataframe and threshold for missing values. Returns a dataframe.
  total_records = df.____()
  for col in df.columns:
    # Calculate the percentage of missing values
    missing = df.____(df[col].____()).____()
    missing_percent = ____ / ____
    # Drop column if percent of missing is more than threshold
    if ____ > ____:
      df = df.____(col)
  return df

# Drop columns that are more than 60% missing
df = ____(____, ____)
Modifier et exécuter le code