Visualiser les valeurs manquantes
Pouvoir représenter les valeurs manquantes est un excellent moyen de comprendre rapidement quelle part de vos données manque. Cela permet aussi de repérer des motifs de données manquantes, qu’il faudra traiter avec soin pour éviter de biaiser votre modèle.
Quelle variable contient le plus de valeurs manquantes ? Exécutez toutes les lignes de code sauf la dernière pour déterminer la réponse. Une fois sûr de vous, remplissez la valeur et cliquez sur "Soumettre la réponse".
Cet exercice fait partie du cours
<cours>Feature Engineering avec PySpark</cours>Instructions de l’exercice
- Utilisez
select()pour sous-ensembler le dataframedfavec la liste de colonnescolumns, puis échantillonnez avec la fonctionsample()fournie, et affectez ce dataframe à la variablesample_df. - Convertissez le sous-ensemble en un dataframe
pandaspandas_df, puis utilisezpandasisnull()pour transformer ceDataFrameen True/False. Stockez ce résultat danstf_df. - Utilisez
heatmap()de seaborn pour tracertf_df. - Cliquez sur "Exécuter le code" pour afficher le graphique. Ensuite, affectez le nom de la variable avec le plus de valeurs manquantes à
answer.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Sample the dataframe and convert to Pandas
____ = df.select(____).sample(False, 0.1, 42)
____ = ____.toPandas()
# Convert all values to T/F
tf_df = ____.____()
# Plot it
sns.____(data=____)
plt.xticks(rotation=30, fontsize=10)
plt.yticks(rotation=0, fontsize=10)
plt.show()
# Set the answer to the column with the most missing data
answer = '____'