Bootstrap multiplu cu beeswarm
Locuind în prezent în Cincinnati, ești curios/curioasă să vezi cum se compară valorile medii de NO2 cu cele din Des Moines, Indianapolis și Houston – alte câteva orașe în care ai locuit.
Pentru a analiza acest lucru, decizi să folosești estimarea bootstrap pentru a examina valorile medii ale NO2 pentru fiecare oraș. Deoarece comparațiile reprezintă principalul interes, vei folosi un swarm plot pentru a compara estimările.
DataFrame-ul pollution_may este disponibil împreună cu funcția bootstrap() prezentată în slide-uri, pentru a efectua rééșantionarea bootstrap.
Acest exercițiu face parte din cursul
Îmbunătățirea vizualizărilor de date în Python
Instrucțiuni pentru exercițiu
- Aplică rééșantionarea bootstrap pe fiecare vector
city_NO2. - Adaugă numele orașului ca o coloană în DataFrame-ul bootstrap,
cur_boot. - Colorează toate punctele din swarm plot cu
'coral'pentru a evita problema culoare-dimensiune.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Initialize a holder DataFrame for bootstrap results
city_boots = pd.DataFrame()
for city in ['Cincinnati', 'Des Moines', 'Indianapolis', 'Houston']:
# Filter to city
city_NO2 = pollution_may[pollution_may.city == city].NO2
# Bootstrap city data & put in DataFrame
cur_boot = pd.DataFrame({'NO2_avg': bootstrap(____, 100), 'city': ____})
# Append to other city's bootstraps
city_boots = pd.concat([city_boots,cur_boot])
# Beeswarm plot of averages with citys on y axis
sns.swarmplot(y = "city", x = "NO2_avg", data = city_boots, ____ = '____')
plt.show()