Візуалізація імпутацій
Аналіз імпутацій і вибір найкращої — це завдання, що потребує багатьох експериментів. Важливо стежити, щоб під час імпутації ваші дані не стали упередженими. У двох останніх вправах ви створили 4 різні імпутації: за середнім, медіаною, модою та заповненням константою.
У цій вправі ви побудуєте діаграму розсіювання для датафреймів, які імпутували раніше. Для цього ви створите словник із цих датафреймів, де ключами будуть їхні назви.
Датафрейми diabetes_mean, diabetes_median, diabetes_mode і diabetes_constant уже завантажено для вас.
Ця вправа є частиною курсу
Робота з пропущеними даними в Python
Інструкції до вправи
- Створіть 4 підграфіки, побудувавши рисунок із 2 рядків і 2 стовпців.
- Створіть словник
imputations, зіставивши кожен ключ із відповідним датафреймом. - Проітеруйте
axesіimputationsта побудуйте кожен датафрейм зі словникаimputations. - Задайте колір для
nullityі встановіть заголовок кожного підграфіка як назву імпутації.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()
# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___,
'Most Frequent Imputation': ___, 'Constant Imputation': ___}
# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
# Select and also set the title for a DataFrame
imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter',
alpha=0.5, c=___, cmap='rainbow', ax=ax,
colorbar=False, title=___)
plt.show()