Začněte nyníZačněte zdarma

Vytvoření zástupných hodnot

Podobně jako jsi hledal/a vztahy mezi chybějícími hodnotami v různých sloupcích, je důležité zkoumat také vztah mezi chybějícími a nechybějícími hodnotami. Pomůže ti to odhalit faktory způsobující chybějící hodnoty v datech.

BMI vs Serum Insulin

Z grafu výše vidíš, že chybějící hodnoty Serum Insulin jsou rozloženy napříč celým rozsahem hodnot BMI. To naznačuje, že mezi nimi žádný vztah není!

V tomto cvičení napíšeš funkci pro generování zástupných hodnot, které poslouží k vytvoření výše zobrazeného bodového grafu (v příštím cvičení). Generování zástupných hodnot zahrnuje škálování náhodných hodnot na rozsah sloupce pomocí škálovacího faktoru a jejich posunutí.

Funkce rand() je již naimportována z numpy.random.

Toto cvičení je součástí kurzu

Dealing with Missing Data in Python

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

def fill_dummy_values(df):
  df_dummy = df.copy(deep=True)
  for col_name in df_dummy:
    col = df_dummy[col_name]
    # Calculate column range
    col_range = ___ - ___
  return df_dummy
Upravit a spustit kód