Выделение значений на распределении
Иногда перед построением визуализации данные необходимо предварительно обработать. Для работы с пропущенными значениями можно использовать методы .dropna() и .fillna(). Выбросы удаляются путём фильтрации записей, выходящих за пределы определённого процентиля, — для этого применяется метод .quantile() к нужному столбцу.
В видео также было показано, как выделить конкретное значение на графике, добавив вертикальную линию в позиции x:
Axes.axvline(x=0, color=None, ...)
В этом упражнении вы ещё раз изучите глобальное распределение доходов: удалите выбросы выше 95-го процентиля, построите распределение и выделите среднее значение и медиану. Библиотеки pandas как pd, seaborn как sns и matplotlib.pyplot как plt уже импортированы, а DataFrame income из предыдущих упражнений доступен в вашем рабочем пространстве.
Это упражнение является частью курса
Импорт и управление финансовыми данными в Python
Инструкции к упражнению
- Присвойте столбец
'Income per Capita'переменнойinc_per_capita. - Отфильтруйте
inc_per_capita, оставив только строки со значениями ниже 95-го процентиля. Сохраните результат в ту же переменную. - Постройте гистограмму по умолчанию для отфильтрованного
inc_per_capitaи присвойте результат переменнойax. - С помощью
ax.axvline()с параметромcolor='b'выделите среднее значениеinc_per_capitaсиним цветом. - С помощью
ax.axvline()с параметромcolor='g'выделите медиану зелёным цветом. Отобразите результат!
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create inc_per_capita
inc_per_capita = ____
# Filter out incomes above the 95th percentile
inc_per_capita = inc_per_capita[____ < ____]
# Plot histogram and assign to ax
ax = ____
# Highlight mean
ax.axvline(inc_per_capita.mean(), color='b')
# Highlight median
ax.axvline(inc_per_capita.median(), color='g')
# Show the plot
plt.show()