Wypełnianie wartościami zastępczymi
Podobnie jak szukasz zależności między brakami danych w różnych kolumnach, ważne jest też sprawdzenie, czy istnieje związek między brakami a wartościami dostępnymi w innych kolumnach. Pomoże ci to zidentyfikować czynniki wpływające na brakowanie danych.
Na powyższym wykresie widać, że brakujące wartości zmiennej Serum Insulin są rozłożone równomiernie w całym zakresie wartości BMI. Oznacza to jedynie, że nie ma między nimi żadnej zależności!
W tym ćwiczeniu napiszesz funkcję generującą wartości zastępcze, które posłużą do stworzenia powyższego wykresu punktowego (w następnym ćwiczeniu). Generowanie wartości zastępczych polega na przeskalowaniu losowych wartości do zakresu kolumny przy użyciu współczynnika skalowania oraz przesunięciu tych wartości.
Funkcja rand() została już zaimportowana z biblioteki numpy.random.
To ćwiczenie jest częścią kursu
Braki danych w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
def fill_dummy_values(df):
df_dummy = df.copy(deep=True)
for col_name in df_dummy:
col = df_dummy[col_name]
# Calculate column range
col_range = ___ - ___
return df_dummy