Построение диаграммы рассеяния с учётом пропущенных значений
В этом упражнении вы создадите диаграмму рассеяния, включающую как пропущенные, так и непропущенные значения. Для заполнения фиктивными значениями в DataFrame diabetes_dummy вы воспользуетесь функцией fill_dummy_values(), которую создали в предыдущем упражнении.
Признак пропущенности столбца вычисляется с помощью метода .isnull(), который возвращает объект pd.Series со значениями True или False.
Чтобы выделить пропущенные и непропущенные значения разными цветами, достаточно объединить признаки пропущенности с помощью операции ИЛИ (|) по отображаемым столбцам. Результат будет следующим:
True\(\rightarrow\) пропущено значениеcol1,col2или обоих столбцов.False\(\rightarrow\) ни одно из значенийcol1иcol2не пропущено.
Для работы уже загружены DataFrame diabetes и функция fill_dummy_values().
Это упражнение является частью курса
Работа с пропущенными данными в Python
Инструкции к упражнению
- Примените операцию ИЛИ, чтобы объединить признаки пропущенности столбцов
Skin_FoldиBMI. - Заполните фиктивными значениями DataFrame
diabetes_dummyс помощью функцииfill_dummy_values(). - Постройте диаграмму рассеяния
'BMI'относительно'Skin_Fold'; обратите внимание: «Y относительно X» означает, что Y откладывается по вертикальной оси, а X — по горизонтальной.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Use OR operation to combine Skin_Fold and BMI nullity
nullity = ___
# Fill dummy values in diabetes_dummy
diabetes_dummy = ___
# Create a scatter plot of BMI versus Skin_Fold
diabetes_dummy.plot(x=___, y=___, kind='___', alpha=0.5,
# Set color to nullity of BMI and Skin_Fold
c=___,
cmap='rainbow')
plt.show()