CommencezCommencez gratuitement

Imputation des données manquantes

Les données manquantes, ça arrive. Si nous supposons que nos données sont manquantes complètement au hasard, nous présumons que les données dont nous disposons représentent bien la population. S'il ne manque que quelques valeurs, on peut les retirer ou utiliser la moyenne ou la médiane comme valeur de remplacement. Dans cet exercice, nous allons examiner 'PDOM' : le nombre de jours sur le marché au prix actuel.

Cette activité fait partie du cours

Ingénierie des caractéristiques avec PySpark

Voir le cours

Instructions de l’exercice

  • Obtenez le nombre de valeurs manquantes dans la colonne 'PDOM' à l'aide de where(), isNull() et count().
  • Calculez la valeur moyenne de 'PDOM' à l'aide de la fonction d'agrégation mean().
  • Utilisez fillna() avec la valeur définie à la moyenne de 'PDOM' et appliquez-la uniquement à la colonne 'PDOM' à l'aide du paramètre subset.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Count missing rows
missing = df.____(df[____].____()).____()

# Calculate the mean value
col_mean = df.____({____: ____}).____()[0][0]

# Replacing with the mean value for that column
df.____(____, ____=[____])
Modifier et exécuter le code