Определение экстремальных значений
Вы уже создали датафрейм с данными о доле испаноязычного населения по штатам в разбивке по расовой самоидентификации. Теперь давайте изучим его подробнее — начнём с построения ящичной диаграммы в seaborn.
Также вы найдёте штаты с наибольшей и наименьшей долей испаноязычных жителей, идентифицирующих себя с определёнными расами. Для этого вы воспользуетесь методом squeeze(), который преобразует датафрейм из одной строки в серию (на датафреймы с более чем одной строкой этот метод не влияет).
Библиотека pandas уже импортирована. Загружен датафрейм states_hr, содержащий процентные показатели расовой самоидентификации по 7 расовым категориям.
Это упражнение является частью курса
Анализ данных переписи населения США в Python
Инструкции к упражнению
- Создайте ящичную диаграмму, передав имя датафрейма в параметр
data. (Параметрorient = "h"отобразит диаграммы горизонтально.) - С помощью
squeezeвыведите штат с наибольшим значением в столбцеhispanic_white. - С помощью
squeezeвыведите штат с наименьшим значением в столбцеhispanic_other. - Обратите внимание, что очень немногие испаноязычные жители идентифицируют себя как азиаты, однако один штат является выбросом с высоким значением. С помощью
squeezeвыведите штат с наибольшим значением в столбцеhispanic_asian.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import seaborn and matplotlib.plt
import matplotlib.pyplot as plt
import seaborn as sns
sns.set()
# Create a boxplot
sns.boxplot(data = ____, orient = "h")
plt.show()
# Show states with extreme values in various columns
print(states_hr.nlargest(1, ____).squeeze())
print(states_hr.nsmallest(____).____)
print(____)