Identifică valorile extreme
Acum că ai creat un DataFrame cu procentajul de auto-identificare rasială hispanică pe stat, îl vei explora mai în detaliu, începând cu crearea unui boxplot folosind seaborn.
Vei identifica și statele cu cel mai mare sau cel mai mic procentaj de hispanici care se auto-identifică cu anumite rase. Pentru aceasta, vei aplica metoda squeeze(). Aceasta convertește un DataFrame cu un singur rând într-o serie (fără niciun efect dacă DataFrame-ul are mai mult de un rând).
pandas a fost importat. DataFrame-ul states_hr este încărcat și conține procentaje de auto-identificare rasială pentru 7 categorii rasiale diferite.
Acest exercițiu face parte din cursul
Analiza datelor recensământului SUA în Python
Instrucțiuni pentru exercițiu
- Creează un boxplot setând parametrul
datala numele DataFrame-ului. (orient = "h"va trasa boxplot-urile orizontal.) - Folosind
squeeze, afișează statul cu cea mai mare valoare din coloanahispanic_white. - Folosind
squeeze, afișează statul cu cea mai mică valoare din coloanahispanic_other. - Observă că foarte puțini hispanici se identifică drept asiatici, dar un stat apare ca un outlier ridicat. Folosind
squeeze, afișează statul cu cea mai mare valoare din coloanahispanic_asian.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import seaborn and matplotlib.plt
import matplotlib.pyplot as plt
import seaborn as sns
sns.set()
# Create a boxplot
sns.boxplot(data = ____, orient = "h")
plt.show()
# Show states with extreme values in various columns
print(states_hr.nlargest(1, ____).squeeze())
print(states_hr.nsmallest(____).____)
print(____)