Repérer les valeurs extrêmes
Maintenant que vous avez créé un DataFrame avec le pourcentage d'auto-identification hispanique par État, vous allez l'explorer davantage, en commençant par créer un diagramme à moustaches avec seaborn.
Vous trouverez aussi les États ayant le pourcentage le plus élevé ou le plus faible d'Hispaniques qui s'identifient à certaines races. Pour ce faire, vous appliquerez la méthode squeeze(). Cette méthode convertit un DataFrame d'une seule ligne en série (sans effet sur un DataFrame de plus d'une ligne).
pandas a été importé. Le DataFrame states_hr est chargé et contient les pourcentages d'auto-identification raciale pour 7 catégories de race différentes.
Cette activité fait partie du cours
Analyser les données du recensement des États-Unis avec Python
Instructions de l’exercice
- Créez un diagramme à moustaches en définissant le paramètre
datasur le nom du DataFrame. (orient = "h"trace les diagrammes à moustaches à l'horizontal.) - En utilisant
squeeze, affichez l'État ayant la valeur la plus élevée dans la colonnehispanic_white. - En utilisant
squeeze, affichez l'État ayant la valeur la plus faible dans la colonnehispanic_other. - Remarquez que très peu d'Hispaniques s'identifient comme Asiatiques, mais qu'un État est un fort cas aberrant. En utilisant
squeeze, affichez l'État ayant la valeur la plus élevée dans la colonnehispanic_asian.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import seaborn and matplotlib.plt
import matplotlib.pyplot as plt
import seaborn as sns
sns.set()
# Create a boxplot
sns.boxplot(data = ____, orient = "h")
plt.show()
# Show states with extreme values in various columns
print(states_hr.nlargest(1, ____).squeeze())
print(states_hr.nsmallest(____).____)
print(____)