Fyll i dummyvärden
Precis som du försökte hitta samband mellan saknade värden i olika kolumner, är det också viktigt att undersöka sambandet mellan saknade och icke-saknade värden i kolumnerna. Det hjälper dig att identifiera eventuella faktorer bakom saknade värden i datan.
I figuren ovan kan du se att de saknade värdena för Serum Insulin är spridda över hela spannet av BMI-värden. Det tyder på att det inte finns något samband!
I den här övningen ska du skriva en funktion som genererar dummyvärden för att skapa spridningsdiagrammet ovan (i nästa övning). Dummyvärden genereras genom att slumpmässiga värden skalas till kolumnens värdeintervall med hjälp av en skalningsfaktor, och sedan förskjuts.
Funktionen rand() har redan importerats åt dig från numpy.random.
Den här övningen är en del av kursen
Hantera saknade värden i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
def fill_dummy_values(df):
df_dummy = df.copy(deep=True)
for col_name in df_dummy:
col = df_dummy[col_name]
# Calculate column range
col_range = ___ - ___
return df_dummy