CommencezCommencez gratuitement

Beaucoup de bootstrap avec des essaims de points

Comme vous habitez présentement à Cincinnati, vous êtes curieux de comparer les valeurs moyennes de NO2 avec celles de Des Moines, Indianapolis et Houston : quelques autres villes où vous avez déjà vécu.

Pour ce faire, vous décidez d'utiliser l'estimation par bootstrap pour examiner les valeurs moyennes de NO2 pour chaque ville. Comme ce sont les comparaisons qui vous intéressent d'abord et avant tout, vous utiliserez un diagramme en essaim pour comparer les estimations.

Le DataFrame pollution_may est fourni, ainsi que la fonction bootstrap() présentée dans le diaporama pour effectuer votre rééchantillonnage bootstrap.

Cette activité fait partie du cours

Améliorer vos visualisations de données en Python

Voir le cours

Instructions de l’exercice

  • Exécutez le rééchantillonnage bootstrap sur chaque vecteur city_NO2.
  • Ajoutez le nom de la ville comme colonne dans le DataFrame de bootstrap, cur_boot.
  • Colorez tous les points du diagramme en essaim en 'coral' pour éviter le problème de taille lié aux couleurs.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Initialize a holder DataFrame for bootstrap results
city_boots = pd.DataFrame()

for city in ['Cincinnati', 'Des Moines', 'Indianapolis', 'Houston']:
    # Filter to city
    city_NO2 = pollution_may[pollution_may.city  ==  city].NO2
    # Bootstrap city data & put in DataFrame
    cur_boot = pd.DataFrame({'NO2_avg': bootstrap(____, 100), 'city': ____})
    # Append to other city's bootstraps
    city_boots = pd.concat([city_boots,cur_boot])

# Beeswarm plot of averages with citys on y axis
sns.swarmplot(y = "city", x = "NO2_avg", data = city_boots, ____ = '____')

plt.show()
Modifier et exécuter le code