CommencezCommencez gratuitement

Repérer les valeurs extrêmes

Maintenant que vous avez créé un DataFrame avec le pourcentage d'auto-identification hispanique par État, vous allez l'explorer davantage, en commençant par créer un diagramme à moustaches avec seaborn.

Vous trouverez aussi les États ayant le pourcentage le plus élevé ou le plus faible d'Hispaniques qui s'identifient à certaines races. Pour ce faire, vous appliquerez la méthode squeeze(). Cette méthode convertit un DataFrame d'une seule ligne en série (sans effet sur un DataFrame de plus d'une ligne).

pandas a été importé. Le DataFrame states_hr est chargé et contient les pourcentages d'auto-identification raciale pour 7 catégories de race différentes.

Cette activité fait partie du cours

Analyser les données du recensement des États-Unis avec Python

Voir le cours

Instructions de l’exercice

  • Créez un diagramme à moustaches en définissant le paramètre data sur le nom du DataFrame. (orient = "h" trace les diagrammes à moustaches à l'horizontal.)
  • En utilisant squeeze, affichez l'État ayant la valeur la plus élevée dans la colonne hispanic_white.
  • En utilisant squeeze, affichez l'État ayant la valeur la plus faible dans la colonne hispanic_other.
  • Remarquez que très peu d'Hispaniques s'identifient comme Asiatiques, mais qu'un État est un fort cas aberrant. En utilisant squeeze, affichez l'État ayant la valeur la plus élevée dans la colonne hispanic_asian.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import seaborn and matplotlib.plt
import matplotlib.pyplot as plt
import seaborn as sns
sns.set()

# Create a boxplot
sns.boxplot(data = ____, orient = "h")
plt.show()

# Show states with extreme values in various columns
print(states_hr.nlargest(1, ____).squeeze())
print(states_hr.nsmallest(____).____)
print(____)
Modifier et exécuter le code