Anotando intervalos de confiança
Seu trabalho em ciência de dados com dados de poluição é lendário, e agora você está avaliando propostas de emprego em Cincinnati, Ohio, e Indianapolis, Indiana. Você quer ver se os níveis de SO2 são significativamente diferentes nas duas cidades e, mais especificamente, qual delas tem níveis menores. Para testar isso, você decide olhar as diferenças nos valores de SO2 das cidades (Indianapolis - Cincinnati) ao longo de vários anos (fornecidas em diffs_by_year).
Em vez de mostrar apenas um p-valor para a diferença significativa entre as cidades, você decide analisar os intervalos de confiança de 95% (colunas lower e upper) das diferenças. Isso permite ver a magnitude das diferenças junto com possíveis tendências ao longo dos anos.
Este exercicio faz parte do curso
Aprimorando suas visualizações de dados em Python
Instruções do exercicio
- Forneça limites inicial e final (colunas
lowereupper) para seus intervalos de confiança emplt.hlines(). - Defina a espessura do intervalo como
5. - Desenhe uma linha vertical representando a diferença
0complt.axvline(). - Pinte a linha nula de
'orangered'para destacá-la.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Set start and ends according to intervals
# Make intervals thicker
plt.hlines(y = 'year', xmin = '____', xmax = '____',
linewidth = ____, color = 'steelblue', alpha = 0.7,
data = diffs_by_year)
# Point estimates
plt.plot('mean', 'year', 'k|', data = diffs_by_year)
# Add a 'null' reference line at 0 and color orangered
plt.axvline(x = ____, color = '____', linestyle = '--')
# Set descriptive axis labels and title
plt.xlabel('95% CI')
plt.title('Avg SO2 differences between Cincinnati and Indianapolis')
plt.show()