НачатьНачать бесплатно

Построение диаграммы рассеяния с учётом пропущенных значений

В этом упражнении вы создадите диаграмму рассеяния, включающую как пропущенные, так и непропущенные значения. Для заполнения фиктивными значениями в DataFrame diabetes_dummy вы воспользуетесь функцией fill_dummy_values(), которую создали в предыдущем упражнении.

Признак пропущенности столбца вычисляется с помощью метода .isnull(), который возвращает объект pd.Series со значениями True или False.

Чтобы выделить пропущенные и непропущенные значения разными цветами, достаточно объединить признаки пропущенности с помощью операции ИЛИ (|) по отображаемым столбцам. Результат будет следующим:

  • True \(\rightarrow\) пропущено значение col1, col2 или обоих столбцов.
  • False \(\rightarrow\) ни одно из значений col1 и col2 не пропущено.

Для работы уже загружены DataFrame diabetes и функция fill_dummy_values().

Это упражнение является частью курса

Работа с пропущенными данными в Python

Посмотреть курс

Инструкции к упражнению

  • Примените операцию ИЛИ, чтобы объединить признаки пропущенности столбцов Skin_Fold и BMI.
  • Заполните фиктивными значениями DataFrame diabetes_dummy с помощью функции fill_dummy_values().
  • Постройте диаграмму рассеяния 'BMI' относительно 'Skin_Fold'; обратите внимание: «Y относительно X» означает, что Y откладывается по вертикальной оси, а X — по горизонтальной.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Use OR operation to combine Skin_Fold and BMI nullity
nullity = ___

# Fill dummy values in diabetes_dummy
diabetes_dummy = ___

# Create a scatter plot of BMI versus Skin_Fold
diabetes_dummy.plot(x=___, y=___, kind='___', alpha=0.5,                     
                    # Set color to nullity of BMI and Skin_Fold
                    c=___, 
                    cmap='rainbow')

plt.show()
Редактировать и запускать код