Zacznij terazZacznij za darmo

Wypełnianie wartościami zastępczymi

Podobnie jak szukasz zależności między brakami danych w różnych kolumnach, ważne jest też sprawdzenie, czy istnieje związek między brakami a wartościami dostępnymi w innych kolumnach. Pomoże ci to zidentyfikować czynniki wpływające na brakowanie danych.

BMI vs Serum Insulin

Na powyższym wykresie widać, że brakujące wartości zmiennej Serum Insulin są rozłożone równomiernie w całym zakresie wartości BMI. Oznacza to jedynie, że nie ma między nimi żadnej zależności!

W tym ćwiczeniu napiszesz funkcję generującą wartości zastępcze, które posłużą do stworzenia powyższego wykresu punktowego (w następnym ćwiczeniu). Generowanie wartości zastępczych polega na przeskalowaniu losowych wartości do zakresu kolumny przy użyciu współczynnika skalowania oraz przesunięciu tych wartości.

Funkcja rand() została już zaimportowana z biblioteki numpy.random.

To ćwiczenie jest częścią kursu

Braki danych w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

def fill_dummy_values(df):
  df_dummy = df.copy(deep=True)
  for col_name in df_dummy:
    col = df_dummy[col_name]
    # Calculate column range
    col_range = ___ - ___
  return df_dummy
Edytuj i uruchom kod