Kom igångKom igång gratis

Identifiera extremvärden

Nu när du har skapat en DataFrame med andelen hispanier som identifierar sig med olika raser per delstat, ska du utforska den vidare – med start i ett lådagram med hjälp av seaborn.

Du kommer också att hitta de delstater som har störst eller minst andel hispanier som identifierar sig med en viss ras. För att göra det använder du metoden squeeze(). Den konverterar en DataFrame med en enda rad till en serie (och har ingen effekt om DataFrame innehåller fler än en rad).

pandas har importerats. DataFrame:en states_hr är laddad och innehåller procentandelar för rasidentifikation inom 7 olika raskategorier.

Den här övningen är en del av kursen

Analys av amerikansk folkräkningsdata i Python

Visa kurs

Övningsinstruktioner

  • Skapa ett lådagram genom att ange data-parametern som namnet på DataFrame:en. (orient = "h" ritar lådagrammen horisontellt.)
  • Använd squeeze för att visa den delstat som har det största värdet i kolumnen hispanic_white.
  • Använd squeeze för att visa den delstat som har det minsta värdet i kolumnen hispanic_other.
  • Observera att väldigt få hispanier identifierar sig som asiatiska, men en delstat är en tydlig högt liggande extrempunkt. Använd squeeze för att visa den delstat som har det största värdet i kolumnen hispanic_asian.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import seaborn and matplotlib.plt
import matplotlib.pyplot as plt
import seaborn as sns
sns.set()

# Create a boxplot
sns.boxplot(data = ____, orient = "h")
plt.show()

# Show states with extreme values in various columns
print(states_hr.nlargest(1, ____).squeeze())
print(states_hr.nsmallest(____).____)
print(____)
Redigera och kör kod