НачатьНачать бесплатно

Определение MNAR

В предыдущем упражнении вы определяли тип пропущенных значений по сводке пропусков. В этом упражнении вы продолжите в том же направлении и убедитесь, что данные относятся к типу Missing Not at Random (MNAR) — «пропуски не случайны».

Сводка пропущенных значений для DataFrame diabetes представлена ниже.

Ваша задача — отсортировать DataFrame diabetes по столбцу Serum_Insulin и выявить корреляцию между Skin_Fold и Serum_Insulin.

Обратите внимание: вместо plt.show() здесь используется специальная функция display() — для удобного просмотра результатов.

Это упражнение является частью курса

Работа с пропущенными данными в Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте пакет missingno под псевдонимом msno.
  • Отсортируйте значения столбца Serum_Insulin в DataFrame diabetes.
  • Визуализируйте сводку пропущенных значений для Serum_Insulin с помощью msno.matrix().

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import missingno as msno
___

# Sort diabetes dataframe on 'Serum Insulin'
sorted_values = ___.___(___)

# Visualize the missingness summary of sorted
___.___(___)

# Display nullity matrix
display("/usr/local/share/datasets/matrix_sorted.png")
Редактировать и запускать код