НачатьНачать бесплатно

Заполнение фиктивными значениями

Так же как вы искали связи между пропущенными значениями в разных столбцах, важно также выявлять связи между пропущенными и непропущенными значениями. Это поможет вам понять факторы, влияющие на пропуски в данных.

BMI vs Serum Insulin

На рисунке выше видно, что пропущенные значения Serum Insulin распределены по всему диапазону значений BMI. Это говорит лишь об одном: связи между ними нет!

В этом упражнении вы напишете функцию для генерации фиктивных значений, которые понадобятся для построения показанной выше диаграммы рассеяния (в следующем упражнении). Генерация фиктивных значений включает масштабирование случайных значений к диапазону столбца с помощью коэффициента масштабирования и последующий сдвиг значений.

Функция rand() уже импортирована из numpy.random.

Это упражнение является частью курса

Работа с пропущенными данными в Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

def fill_dummy_values(df):
  df_dummy = df.copy(deep=True)
  for col_name in df_dummy:
    col = df_dummy[col_name]
    # Calculate column range
    col_range = ___ - ___
  return df_dummy
Редактировать и запускать код