Identifiera extremvärden
Nu när du har skapat en DataFrame med andelen hispanier som identifierar sig med olika raser per delstat, ska du utforska den vidare – med start i ett lådagram med hjälp av seaborn.
Du kommer också att hitta de delstater som har störst eller minst andel hispanier som identifierar sig med en viss ras. För att göra det använder du metoden squeeze(). Den konverterar en DataFrame med en enda rad till en serie (och har ingen effekt om DataFrame innehåller fler än en rad).
pandas har importerats. DataFrame:en states_hr är laddad och innehåller procentandelar för rasidentifikation inom 7 olika raskategorier.
Den här övningen är en del av kursen
Analys av amerikansk folkräkningsdata i Python
Övningsinstruktioner
- Skapa ett lådagram genom att ange
data-parametern som namnet på DataFrame:en. (orient = "h"ritar lådagrammen horisontellt.) - Använd
squeezeför att visa den delstat som har det största värdet i kolumnenhispanic_white. - Använd
squeezeför att visa den delstat som har det minsta värdet i kolumnenhispanic_other. - Observera att väldigt få hispanier identifierar sig som asiatiska, men en delstat är en tydlig högt liggande extrempunkt. Använd
squeezeför att visa den delstat som har det största värdet i kolumnenhispanic_asian.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import seaborn and matplotlib.plt
import matplotlib.pyplot as plt
import seaborn as sns
sns.set()
# Create a boxplot
sns.boxplot(data = ____, orient = "h")
plt.show()
# Show states with extreme values in various columns
print(states_hr.nlargest(1, ____).squeeze())
print(states_hr.nsmallest(____).____)
print(____)