Imputation des données manquantes
Les données manquantes, ça arrive. Si nous supposons que les données manquent complètement de façon aléatoire, nous faisons l’hypothèse que les données dont nous disposons représentent bien la population. S’il y a peu de valeurs manquantes, nous pouvons les supprimer ou utiliser la moyenne ou la médiane comme valeur de remplacement. Dans cet exercice, nous allons nous intéresser à 'PDOM' : le nombre de jours sur le marché au prix actuel.
Cet exercice fait partie du cours
<cours>Feature Engineering avec PySpark</cours>Instructions de l’exercice
- Comptez les valeurs manquantes dans la colonne
'PDOM'en utilisantwhere(),isNull()etcount(). - Calculez la moyenne de
'PDOM'avec la fonction d’agrégationmean(). - Utilisez
fillna()avec la valeur définie sur la moyenne de'PDOM'et appliquez-la uniquement à la colonne'PDOM'via le paramètresubset.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Count missing rows
missing = df.____(df[____].____()).____()
# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]
# Replacing with the mean value for that column
df.____(____, ____=[____])