Adnotowanie przedziałów ufności
Twoja praca z danymi o zanieczyszczeniu powietrza jest ceniona w branży i właśnie rozważasz oferty pracy w Cincinnati (Ohio) oraz Indianapolis (Indiana). Chcesz sprawdzić, czy poziomy SO2 w tych dwóch miastach różnią się istotnie – a dokładniej, które miasto ma niższe wartości. W tym celu analizujesz różnice w poziomach SO2 (Indianapolis minus Cincinnati) na przestrzeni wielu lat (dane dostępne jako diffs_by_year).
Zamiast ograniczać się do wyświetlenia wartości p dla istotnej różnicy między miastami, postanawiasz przyjrzeć się 95-procentowym przedziałom ufności (kolumny lower i upper) tych różnic. Dzięki temu możesz ocenić zarówno wielkość różnic, jak i ewentualne trendy na przestrzeni lat.
To ćwiczenie jest częścią kursu
Ulepszanie wizualizacji danych w Pythonie
Instrukcje do ćwiczenia
- Podaj wartości graniczne (kolumny
loweriupper) jako początki i końce przedziałów ufności w funkcjiplt.hlines(). - Ustaw grubość linii przedziałów na
5. - Narysuj linię pionową reprezentującą różnicę równą
0, używając funkcjiplt.axvline(). - Pokoloruj linię zerową na
'orangered', aby się wyróżniała.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Set start and ends according to intervals
# Make intervals thicker
plt.hlines(y = 'year', xmin = '____', xmax = '____',
linewidth = ____, color = 'steelblue', alpha = 0.7,
data = diffs_by_year)
# Point estimates
plt.plot('mean', 'year', 'k|', data = diffs_by_year)
# Add a 'null' reference line at 0 and color orangered
plt.axvline(x = ____, color = '____', linestyle = '--')
# Set descriptive axis labels and title
plt.xlabel('95% CI')
plt.title('Avg SO2 differences between Cincinnati and Indianapolis')
plt.show()