Začněte nyníZačněte zdarma

Identifikace extrémních hodnot

Teď, když máš vytvořený DataFrame s procentuálním zastoupením hispánské rasové sebeidentifikace podle státu, prozkoumáš ho blíže – začneme vytvořením krabicového grafu (boxplot) pomocí seaborn.

Také zjistíš, které státy mají nejvyšší nebo nejnižší procento Hispánců identifikujících se s určitou rasou. K tomu použiješ metodu squeeze(). Ta převede jednořádkový DataFrame na sérii (na DataFrame s více než jedním řádkem nemá žádný vliv).

pandas je už naimportován. K dispozici máš DataFrame states_hr, který obsahuje procentuální zastoupení rasové sebeidentifikace pro 7 různých rasových kategorií.

Toto cvičení je součástí kurzu

Analýza dat amerického sčítání lidu v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř krabicový graf (boxplot) tak, že parametr data nastavíš na název DataFramu. (Parametr orient = "h" zobrazí boxploty horizontálně.)
  • Pomocí squeeze zobraz stát s nejvyšší hodnotou ve sloupci hispanic_white.
  • Pomocí squeeze zobraz stát s nejnižší hodnotou ve sloupci hispanic_other.
  • Všimni si, že jen velmi málo Hispánců se identifikuje jako Asiaté – jeden stát ale výrazně vyčnívá jako odlehlá hodnota. Pomocí squeeze zobraz stát s nejvyšší hodnotou ve sloupci hispanic_asian.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import seaborn and matplotlib.plt
import matplotlib.pyplot as plt
import seaborn as sns
sns.set()

# Create a boxplot
sns.boxplot(data = ____, orient = "h")
plt.show()

# Show states with extreme values in various columns
print(states_hr.nlargest(1, ____).squeeze())
print(states_hr.nsmallest(____).____)
print(____)
Upravit a spustit kód