標註信賴區間
你在污染資料上的資料科學工作相當知名,現在正同時考慮來自俄亥俄州辛辛那提與印第安納州印第安納波里的工作邀約。你想檢查兩個城市的 SO2 濃度是否有顯著差異,更進一步地,想知道哪個城市的濃度較低。為了檢驗這點,你決定查看多個年份中兩市 SO2 數值的差(印第安納波里減去辛辛那提),這些資料已整理在 diffs_by_year 中。
你不只想顯示兩市差異的 p 值,而是決定觀察差異的 95% 信賴區間(lower 與 upper 欄位)。這樣可以同時看出差異的幅度,以及多年下來是否有趨勢。
本練習屬於課程
用 Python 改善你的資料視覺化
練習說明
- 將信賴區間的起訖範圍(
lower與upper欄位)提供給plt.hlines()。 - 將區間粗細設定為
5。 - 使用
plt.axvline()畫出代表差異為0的垂直線。 - 將虛無假設的參考線著色為
'orangered',讓它更醒目。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Set start and ends according to intervals
# Make intervals thicker
plt.hlines(y = 'year', xmin = '____', xmax = '____',
linewidth = ____, color = 'steelblue', alpha = 0.7,
data = diffs_by_year)
# Point estimates
plt.plot('mean', 'year', 'k|', data = diffs_by_year)
# Add a 'null' reference line at 0 and color orangered
plt.axvline(x = ____, color = '____', linestyle = '--')
# Set descriptive axis labels and title
plt.xlabel('95% CI')
plt.title('Avg SO2 differences between Cincinnati and Indianapolis')
plt.show()