НачатьНачать бесплатно

Определение экстремальных значений

Вы уже создали датафрейм с данными о доле испаноязычного населения по штатам в разбивке по расовой самоидентификации. Теперь давайте изучим его подробнее — начнём с построения ящичной диаграммы в seaborn.

Также вы найдёте штаты с наибольшей и наименьшей долей испаноязычных жителей, идентифицирующих себя с определёнными расами. Для этого вы воспользуетесь методом squeeze(), который преобразует датафрейм из одной строки в серию (на датафреймы с более чем одной строкой этот метод не влияет).

Библиотека pandas уже импортирована. Загружен датафрейм states_hr, содержащий процентные показатели расовой самоидентификации по 7 расовым категориям.

Это упражнение является частью курса

Анализ данных переписи населения США в Python

Посмотреть курс

Инструкции к упражнению

  • Создайте ящичную диаграмму, передав имя датафрейма в параметр data. (Параметр orient = "h" отобразит диаграммы горизонтально.)
  • С помощью squeeze выведите штат с наибольшим значением в столбце hispanic_white.
  • С помощью squeeze выведите штат с наименьшим значением в столбце hispanic_other.
  • Обратите внимание, что очень немногие испаноязычные жители идентифицируют себя как азиаты, однако один штат является выбросом с высоким значением. С помощью squeeze выведите штат с наибольшим значением в столбце hispanic_asian.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import seaborn and matplotlib.plt
import matplotlib.pyplot as plt
import seaborn as sns
sns.set()

# Create a boxplot
sns.boxplot(data = ____, orient = "h")
plt.show()

# Show states with extreme values in various columns
print(states_hr.nlargest(1, ____).squeeze())
print(states_hr.nsmallest(____).____)
print(____)
Редактировать и запускать код