Calculer les pourcentages de valeurs manquantes
L'automatisation est l'avenir de la science des données. Apprendre à automatiser une partie de la préparation des données rapporte beaucoup. Dans cet exercice, nous allons automatiser la suppression de colonnes lorsque les données manquantes dépassent un seuil donné.
Cette activité fait partie du cours
Ingénierie des caractéristiques avec PySpark
Instructions de l’exercice
- Définissez une fonction
column_dropper()qui prend en paramètresdf, un dataframe, etthreshold, un nombre à virgule entre 0 et 1. - Calculez le pourcentage de valeurs manquantes à l'aide de
where(),isNull()etcount() - Vérifiez si le pourcentage de valeurs manquantes est supérieur au seuil; si c'est le cas, supprimez la colonne avec
drop() - Exécutez
column_dropper()surdfavec un seuil de 0,6
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
def column_dropper(df, threshold):
# Takes a dataframe and threshold for missing values. Returns a dataframe.
total_records = df.____()
for col in df.columns:
# Calculate the percentage of missing values
missing = df.____(df[col].____()).____()
missing_percent = ____ / ____
# Drop column if percent of missing is more than threshold
if ____ > ____:
df = df.____(col)
return df
# Drop columns that are more than 60% missing
df = ____(____, ____)