Vytvoření zástupných hodnot
Podobně jako jsi hledal/a vztahy mezi chybějícími hodnotami v různých sloupcích, je důležité zkoumat také vztah mezi chybějícími a nechybějícími hodnotami. Pomůže ti to odhalit faktory způsobující chybějící hodnoty v datech.
Z grafu výše vidíš, že chybějící hodnoty Serum Insulin jsou rozloženy napříč celým rozsahem hodnot BMI. To naznačuje, že mezi nimi žádný vztah není!
V tomto cvičení napíšeš funkci pro generování zástupných hodnot, které poslouží k vytvoření výše zobrazeného bodového grafu (v příštím cvičení). Generování zástupných hodnot zahrnuje škálování náhodných hodnot na rozsah sloupce pomocí škálovacího faktoru a jejich posunutí.
Funkce rand() je již naimportována z numpy.random.
Toto cvičení je součástí kurzu
Dealing with Missing Data in Python
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
def fill_dummy_values(df):
df_dummy = df.copy(deep=True)
for col_name in df_dummy:
col = df_dummy[col_name]
# Calculate column range
col_range = ___ - ___
return df_dummy