Визуализация импутаций
Анализ импутаций и выбор наилучшей из них — задача, требующая множества экспериментов. Важно следить за тем, чтобы в процессе импутации данные не стали смещёнными. В двух предыдущих упражнениях вы создали 4 различные импутации: с использованием среднего, медианы, моды и заполнения константой.
В этом упражнении вы построите диаграммы рассеяния для DataFrame, которые заполняли ранее. Для этого создайте словарь DataFrame, где ключами будут их названия.
DataFrame diabetes_mean, diabetes_median, diabetes_mode и diabetes_constant уже загружены для вас.
Это упражнение является частью курса
Работа с пропущенными данными в Python
Инструкции к упражнению
- Создайте 4 подграфика: постройте сетку из 2 строк и 2 столбцов.
- Создайте словарь
imputations, сопоставив каждый ключ с соответствующим DataFrame. - Переберите в цикле
axesиimputationsи постройте каждый DataFrame изimputations. - Задайте цвет по значению
nullity, а заголовок каждого подграфика — по названию импутации.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()
# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___,
'Most Frequent Imputation': ___, 'Constant Imputation': ___}
# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
# Select and also set the title for a DataFrame
imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter',
alpha=0.5, c=___, cmap='rainbow', ax=ax,
colorbar=False, title=___)
plt.show()