НачатьНачать бесплатно

Выделение значений на распределении

Иногда перед построением визуализации данные необходимо предварительно обработать. Для работы с пропущенными значениями можно использовать методы .dropna() и .fillna(). Выбросы удаляются путём фильтрации записей, выходящих за пределы определённого процентиля, — для этого применяется метод .quantile() к нужному столбцу.

В видео также было показано, как выделить конкретное значение на графике, добавив вертикальную линию в позиции x:

Axes.axvline(x=0, color=None, ...)

В этом упражнении вы ещё раз изучите глобальное распределение доходов: удалите выбросы выше 95-го процентиля, построите распределение и выделите среднее значение и медиану. Библиотеки pandas как pd, seaborn как sns и matplotlib.pyplot как plt уже импортированы, а DataFrame income из предыдущих упражнений доступен в вашем рабочем пространстве.

Это упражнение является частью курса

Импорт и управление финансовыми данными в Python

Посмотреть курс

Инструкции к упражнению

  • Присвойте столбец 'Income per Capita' переменной inc_per_capita.
  • Отфильтруйте inc_per_capita, оставив только строки со значениями ниже 95-го процентиля. Сохраните результат в ту же переменную.
  • Постройте гистограмму по умолчанию для отфильтрованного inc_per_capita и присвойте результат переменной ax.
  • С помощью ax.axvline() с параметром color='b' выделите среднее значение inc_per_capita синим цветом.
  • С помощью ax.axvline() с параметром color='g' выделите медиану зелёным цветом. Отобразите результат!

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create inc_per_capita
inc_per_capita = ____

# Filter out incomes above the 95th percentile
inc_per_capita = inc_per_capita[____ < ____]

# Plot histogram and assign to ax
ax = ____

# Highlight mean
ax.axvline(inc_per_capita.mean(), color='b')

# Highlight median
ax.axvline(inc_per_capita.median(), color='g')

# Show the plot
plt.show()
Редактировать и запускать код