ПочатиПочніть безкоштовно

Візуалізація імпутацій

Аналіз імпутацій і вибір найкращої — це завдання, що потребує багатьох експериментів. Важливо стежити, щоб під час імпутації ваші дані не стали упередженими. У двох останніх вправах ви створили 4 різні імпутації: за середнім, медіаною, модою та заповненням константою.

У цій вправі ви побудуєте діаграму розсіювання для датафреймів, які імпутували раніше. Для цього ви створите словник із цих датафреймів, де ключами будуть їхні назви.

Датафрейми diabetes_mean, diabetes_median, diabetes_mode і diabetes_constant уже завантажено для вас.

Ця вправа є частиною курсу

Робота з пропущеними даними в Python

Переглянути курс

Інструкції до вправи

  • Створіть 4 підграфіки, побудувавши рисунок із 2 рядків і 2 стовпців.
  • Створіть словник imputations, зіставивши кожен ключ із відповідним датафреймом.
  • Проітеруйте axes і imputations та побудуйте кожен датафрейм зі словника imputations.
  • Задайте колір для nullity і встановіть заголовок кожного підграфіка як назву імпутації.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()

# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___, 
               'Most Frequent Imputation': ___, 'Constant Imputation': ___}

# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
    # Select and also set the title for a DataFrame
    imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter', 
                          alpha=0.5, c=___, cmap='rainbow', ax=ax, 
                          colorbar=False, title=___)
plt.show()
Редагувати та запускати код