CommencerCommencez gratuitement

Visualiser les valeurs manquantes

Pouvoir représenter les valeurs manquantes est un excellent moyen de comprendre rapidement quelle part de vos données manque. Cela permet aussi de repérer des motifs de données manquantes, qu’il faudra traiter avec soin pour éviter de biaiser votre modèle.

Quelle variable contient le plus de valeurs manquantes ? Exécutez toutes les lignes de code sauf la dernière pour déterminer la réponse. Une fois sûr de vous, remplissez la valeur et cliquez sur "Soumettre la réponse".

Cet exercice fait partie du cours

<cours>Feature Engineering avec PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Utilisez select() pour sous-ensembler le dataframe df avec la liste de colonnes columns, puis échantillonnez avec la fonction sample() fournie, et affectez ce dataframe à la variable sample_df.
  • Convertissez le sous-ensemble en un dataframe pandas pandas_df, puis utilisez pandas isnull() pour transformer ce DataFrame en True/False. Stockez ce résultat dans tf_df.
  • Utilisez heatmap() de seaborn pour tracer tf_df.
  • Cliquez sur "Exécuter le code" pour afficher le graphique. Ensuite, affectez le nom de la variable avec le plus de valeurs manquantes à answer.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Sample the dataframe and convert to Pandas
____ = df.select(____).sample(False, 0.1, 42)
____ = ____.toPandas()

# Convert all values to T/F
tf_df = ____.____()

# Plot it
sns.____(data=____)
plt.xticks(rotation=30, fontsize=10)
plt.yticks(rotation=0, fontsize=10)
plt.show()

# Set the answer to the column with the most missing data
answer = '____'
Modifier et exécuter le code