НачатьНачать бесплатно

Визуализация импутаций

Анализ импутаций и выбор наилучшей из них — задача, требующая множества экспериментов. Важно следить за тем, чтобы в процессе импутации данные не стали смещёнными. В двух предыдущих упражнениях вы создали 4 различные импутации: с использованием среднего, медианы, моды и заполнения константой.

В этом упражнении вы построите диаграммы рассеяния для DataFrame, которые заполняли ранее. Для этого создайте словарь DataFrame, где ключами будут их названия.

DataFrame diabetes_mean, diabetes_median, diabetes_mode и diabetes_constant уже загружены для вас.

Это упражнение является частью курса

Работа с пропущенными данными в Python

Посмотреть курс

Инструкции к упражнению

  • Создайте 4 подграфика: постройте сетку из 2 строк и 2 столбцов.
  • Создайте словарь imputations, сопоставив каждый ключ с соответствующим DataFrame.
  • Переберите в цикле axes и imputations и постройте каждый DataFrame из imputations.
  • Задайте цвет по значению nullity, а заголовок каждого подграфика — по названию импутации.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()

# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___, 
               'Most Frequent Imputation': ___, 'Constant Imputation': ___}

# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
    # Select and also set the title for a DataFrame
    imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter', 
                          alpha=0.5, c=___, cmap='rainbow', ax=ax, 
                          colorbar=False, title=___)
plt.show()
Редактировать и запускать код