Визначення екстремальних значень
Тепер, коли ви створили датафрейм із часткою іспаномовних за самоідентифікацією раси в кожному штаті, дослідимо його далі, почавши зі створення boxplot у seaborn.
Ви також знайдете штати з найбільшою та найменшою часткою іспаномовних, які ідентифікують себе як певні раси. Для цього ви застосуєте метод squeeze(). Цей метод перетворює датафрейм з одним рядком на серію (і не впливає на датафрейми з більш ніж одним рядком).
pandas уже імпортовано. Завантажено датафрейм states_hr, який містить відсотки самоідентифікації за 7 різними расовими категоріями.
Ця вправа є частиною курсу
Аналіз даних перепису США в Python
Інструкції до вправи
- Створіть boxplot, встановивши параметр
dataу назву датафрейма. (orient = "h"побудує boxplot-и погоризонталі.) - Використовуючи
squeeze, покажіть штат з найбільшим значенням у стовпціhispanic_white. - Використовуючи
squeeze, покажіть штат з найменшим значенням у стовпціhispanic_other. - Зверніть увагу, що дуже мало іспаномовних ідентифікують себе як азіати, але один штат є високим викидом. Використовуючи
squeeze, покажіть штат з найбільшим значенням у стовпціhispanic_asian.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import seaborn and matplotlib.plt
import matplotlib.pyplot as plt
import seaborn as sns
sns.set()
# Create a boxplot
sns.boxplot(data = ____, orient = "h")
plt.show()
# Show states with extreme values in various columns
print(states_hr.nlargest(1, ____).squeeze())
print(states_hr.nsmallest(____).____)
print(____)