Kom igångKom igång gratis

Fyll i dummyvärden

Precis som du försökte hitta samband mellan saknade värden i olika kolumner, är det också viktigt att undersöka sambandet mellan saknade och icke-saknade värden i kolumnerna. Det hjälper dig att identifiera eventuella faktorer bakom saknade värden i datan.

BMI vs Serum Insulin

I figuren ovan kan du se att de saknade värdena för Serum Insulin är spridda över hela spannet av BMI-värden. Det tyder på att det inte finns något samband!

I den här övningen ska du skriva en funktion som genererar dummyvärden för att skapa spridningsdiagrammet ovan (i nästa övning). Dummyvärden genereras genom att slumpmässiga värden skalas till kolumnens värdeintervall med hjälp av en skalningsfaktor, och sedan förskjuts.

Funktionen rand() har redan importerats åt dig från numpy.random.

Den här övningen är en del av kursen

Hantera saknade värden i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

def fill_dummy_values(df):
  df_dummy = df.copy(deep=True)
  for col_name in df_dummy:
    col = df_dummy[col_name]
    # Calculate column range
    col_range = ___ - ___
  return df_dummy
Redigera och kör kod