Заполнение фиктивными значениями
Так же как вы искали связи между пропущенными значениями в разных столбцах, важно также выявлять связи между пропущенными и непропущенными значениями. Это поможет вам понять факторы, влияющие на пропуски в данных.
На рисунке выше видно, что пропущенные значения Serum Insulin распределены по всему диапазону значений BMI. Это говорит лишь об одном: связи между ними нет!
В этом упражнении вы напишете функцию для генерации фиктивных значений, которые понадобятся для построения показанной выше диаграммы рассеяния (в следующем упражнении). Генерация фиктивных значений включает масштабирование случайных значений к диапазону столбца с помощью коэффициента масштабирования и последующий сдвиг значений.
Функция rand() уже импортирована из numpy.random.
Это упражнение является частью курса
Работа с пропущенными данными в Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
def fill_dummy_values(df):
df_dummy = df.copy(deep=True)
for col_name in df_dummy:
col = df_dummy[col_name]
# Calculate column range
col_range = ___ - ___
return df_dummy