Заповніть фіктивні значення
Подібно до того, як ви перевіряли, чи є зв'язок «пропуски до пропусків» між стовпцями, важливо також з'ясувати зв'язок «пропуски до непропусків» між стовпцями. Це допоможе вам виявити чинники пропусків у даних.
На рисунку вище видно, що пропущені значення Serum Insulin розподілені по всьому діапазону значень BMI. Це означає, що зв'язку немає!
У цій вправі ви напишете функцію для генерування фіктивних значень, щоб побудувати наведений вище діаграму розсіювання (у наступній вправі). Операції зі створення фіктивних значень передбачають масштабування випадкових чисел до діапазону стовпця з коефіцієнтом масштабування та подальше зсування значень.
Функцію rand() уже імпортовано для вас із numpy.random.
Ця вправа є частиною курсу
Робота з пропущеними даними в Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
def fill_dummy_values(df):
df_dummy = df.copy(deep=True)
for col_name in df_dummy:
col = df_dummy[col_name]
# Calculate column range
col_range = ___ - ___
return df_dummy