Générer des valeurs factices
Comme vous avez cherché des liens entre valeurs manquantes d'une colonne et valeurs manquantes d'une autre, il est aussi important d'examiner les liens entre valeurs manquantes et valeurs non manquantes entre colonnes. Cela vous aidera à repérer les facteurs expliquant la présence de valeurs manquantes dans les données.
Dans la figure ci-dessus, vous pouvez observer que les valeurs manquantes de Serum Insulin sont réparties sur toute l'étendue des valeurs de BMI. Cela indique simplement qu'il n'y a pas de relation !
Dans cet exercice, vous allez écrire une fonction pour générer des valeurs factices afin d'aider à créer le nuage de points ci-dessus (dans l'exercice suivant). Pour générer ces valeurs factices, on met à l'échelle des valeurs aléatoires selon l'étendue d'une colonne avec un facteur d'échelle, puis on décale les valeurs.
La fonction rand() a été importée pour vous depuis numpy.random.
Cette activité fait partie du cours
Gérer les données manquantes avec Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
def fill_dummy_values(df):
df_dummy = df.copy(deep=True)
for col_name in df_dummy:
col = df_dummy[col_name]
# Calculate column range
col_range = ___ - ___
return df_dummy