Muitos bootstraps com beeswarms
Como morador atual de Cincinnati, você está curioso para ver como os valores médios de NO2 se comparam aos de Des Moines, Indianapolis e Houston: algumas outras cidades onde você já morou.
Para analisar isso, você decide usar estimação por bootstrap para observar os valores médios de NO2 de cada cidade. Como as comparações são o principal foco, você vai usar um swarm plot para comparar as estimativas.
O DataFrame pollution_may é fornecido junto com a função bootstrap() apresentada nos slides para realizar a reamostragem por bootstrap.
Este exercicio faz parte do curso
Aprimorando suas visualizações de dados em Python
Instruções do exercicio
- Execute a reamostragem por bootstrap em cada vetor
city_NO2. - Adicione o nome da cidade como uma coluna no DataFrame de bootstrap,
cur_boot. - Pinte todos os pontos do swarm plot com a cor
'coral'para evitar o problema de cor-tamanho.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Initialize a holder DataFrame for bootstrap results
city_boots = pd.DataFrame()
for city in ['Cincinnati', 'Des Moines', 'Indianapolis', 'Houston']:
# Filter to city
city_NO2 = pollution_may[pollution_may.city == city].NO2
# Bootstrap city data & put in DataFrame
cur_boot = pd.DataFrame({'NO2_avg': bootstrap(____, 100), 'city': ____})
# Append to other city's bootstraps
city_boots = pd.concat([city_boots,cur_boot])
# Beeswarm plot of averages with citys on y axis
sns.swarmplot(y = "city", x = "NO2_avg", data = city_boots, ____ = '____')
plt.show()