Beaucoup de bootstrap avec des essaims de points
Comme vous habitez présentement à Cincinnati, vous êtes curieux de comparer les valeurs moyennes de NO2 avec celles de Des Moines, Indianapolis et Houston : quelques autres villes où vous avez déjà vécu.
Pour ce faire, vous décidez d'utiliser l'estimation par bootstrap pour examiner les valeurs moyennes de NO2 pour chaque ville. Comme ce sont les comparaisons qui vous intéressent d'abord et avant tout, vous utiliserez un diagramme en essaim pour comparer les estimations.
Le DataFrame pollution_may est fourni, ainsi que la fonction bootstrap() présentée dans le diaporama pour effectuer votre rééchantillonnage bootstrap.
Cette activité fait partie du cours
Améliorer vos visualisations de données en Python
Instructions de l’exercice
- Exécutez le rééchantillonnage bootstrap sur chaque vecteur
city_NO2. - Ajoutez le nom de la ville comme colonne dans le DataFrame de bootstrap,
cur_boot. - Colorez tous les points du diagramme en essaim en
'coral'pour éviter le problème de taille lié aux couleurs.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Initialize a holder DataFrame for bootstrap results
city_boots = pd.DataFrame()
for city in ['Cincinnati', 'Des Moines', 'Indianapolis', 'Houston']:
# Filter to city
city_NO2 = pollution_may[pollution_may.city == city].NO2
# Bootstrap city data & put in DataFrame
cur_boot = pd.DataFrame({'NO2_avg': bootstrap(____, 100), 'city': ____})
# Append to other city's bootstraps
city_boots = pd.concat([city_boots,cur_boot])
# Beeswarm plot of averages with citys on y axis
sns.swarmplot(y = "city", x = "NO2_avg", data = city_boots, ____ = '____')
plt.show()