Completează cu valori fictive
Similar cu modul în care ai căutat relații între valorile lipsă din diferite coloane, este la fel de important să identifici orice relație între valorile lipsă și cele prezente. Acest lucru te va ajuta să înțelegi factorii care determină valorile lipsă din date.
În figura de mai sus, poți observa că valorile lipsă din Serum Insulin sunt distribuite pe întregul interval al valorilor BMI. Aceasta indică faptul că nu există nicio relație între ele!
În acest exercițiu, vei scrie o funcție care generează valori fictive pentru a putea crea graficul scatter de mai sus (în exercițiul următor). Operațiile de generare a valorilor fictive implică scalarea valorilor aleatoare la intervalul unei coloane folosind un factor de scalare, urmată de deplasarea valorilor.
Funcția rand() a fost deja importată pentru tine din numpy.random.
Acest exercițiu face parte din cursul
Gestionarea datelor lipsă în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
def fill_dummy_values(df):
df_dummy = df.copy(deep=True)
for col_name in df_dummy:
col = df_dummy[col_name]
# Calculate column range
col_range = ___ - ___
return df_dummy