Identifikace extrémních hodnot
Teď, když máš vytvořený DataFrame s procentuálním zastoupením hispánské rasové sebeidentifikace podle státu, prozkoumáš ho blíže – začneme vytvořením krabicového grafu (boxplot) pomocí seaborn.
Také zjistíš, které státy mají nejvyšší nebo nejnižší procento Hispánců identifikujících se s určitou rasou. K tomu použiješ metodu squeeze(). Ta převede jednořádkový DataFrame na sérii (na DataFrame s více než jedním řádkem nemá žádný vliv).
pandas je už naimportován. K dispozici máš DataFrame states_hr, který obsahuje procentuální zastoupení rasové sebeidentifikace pro 7 různých rasových kategorií.
Toto cvičení je součástí kurzu
Analýza dat amerického sčítání lidu v Pythonu
Pokyny k cvičení
- Vytvoř krabicový graf (boxplot) tak, že parametr
datanastavíš na název DataFramu. (Parametrorient = "h"zobrazí boxploty horizontálně.) - Pomocí
squeezezobraz stát s nejvyšší hodnotou ve sloupcihispanic_white. - Pomocí
squeezezobraz stát s nejnižší hodnotou ve sloupcihispanic_other. - Všimni si, že jen velmi málo Hispánců se identifikuje jako Asiaté – jeden stát ale výrazně vyčnívá jako odlehlá hodnota. Pomocí
squeezezobraz stát s nejvyšší hodnotou ve sloupcihispanic_asian.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import seaborn and matplotlib.plt
import matplotlib.pyplot as plt
import seaborn as sns
sns.set()
# Create a boxplot
sns.boxplot(data = ____, orient = "h")
plt.show()
# Show states with extreme values in various columns
print(states_hr.nlargest(1, ____).squeeze())
print(states_hr.nsmallest(____).____)
print(____)