CommencerCommencez gratuitement

Imputation des données manquantes

Les données manquantes, ça arrive. Si nous supposons que les données manquent complètement de façon aléatoire, nous faisons l’hypothèse que les données dont nous disposons représentent bien la population. S’il y a peu de valeurs manquantes, nous pouvons les supprimer ou utiliser la moyenne ou la médiane comme valeur de remplacement. Dans cet exercice, nous allons nous intéresser à 'PDOM' : le nombre de jours sur le marché au prix actuel.

Cet exercice fait partie du cours

<cours>Feature Engineering avec PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Comptez les valeurs manquantes dans la colonne 'PDOM' en utilisant where(), isNull() et count().
  • Calculez la moyenne de 'PDOM' avec la fonction d’agrégation mean().
  • Utilisez fillna() avec la valeur définie sur la moyenne de 'PDOM' et appliquez-la uniquement à la colonne 'PDOM' via le paramètre subset.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Count missing rows
missing = df.____(df[____].____()).____()

# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]

# Replacing with the mean value for that column
df.____(____, ____=[____])
Modifier et exécuter le code