Rellenar valores ficticios
Del mismo modo que intentaste encontrar alguna relación de valores ausentes con valores ausentes entre columnas, también es importante buscar relaciones entre valores ausentes y no ausentes entre columnas. Esto te ayudará a detectar factores que expliquen la ausencia de datos.
En la figura anterior, puedes observar que los valores ausentes de Serum Insulin están repartidos a lo largo de todo el rango de valores de BMI. ¡Esto implica que no hay relación!
En este ejercicio, escribirás una función para generar valores ficticios que te ayudarán a crear el diagrama de dispersión anterior (en el siguiente ejercicio). Las operaciones para generar valores ficticios consisten en escalar valores aleatorios al rango de una columna con un factor de escala y desplazar los valores.
La función rand() se ha importado para ti desde numpy.random.
Este ejercicio forma parte del curso
Cómo tratar datos faltantes en Python
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
def fill_dummy_values(df):
df_dummy = df.copy(deep=True)
for col_name in df_dummy:
col = df_dummy[col_name]
# Calculate column range
col_range = ___ - ___
return df_dummy