基本信賴區間
你是在愛荷華州得梅因市一家煙火製造商擔任資料科學家的角色。你需要向市府說明,你們公司的大型煙火秀並沒有對城市空氣造成危害。為此,你會查看 7 月 4 日之後一週的污染物平均濃度,並與上一次煙火秀後的監測數值做比較。透過在平均值周圍呈現信賴區間,你可以主張最近的監測值仍落在正常範圍內。
這份資料已載入為 average_ests,每一列代表一種量測到的污染物。
本練習屬於課程
用 Python 改善你的資料視覺化
練習說明
建立 95% 區間的下界與上界:
- 下界:從估計的
'mean'減去 1.96 個標準誤('std_err')。 - 上界:在估計的
'mean'加上 1.96 個標準誤('std_err')。
- 下界:從估計的
將
pollutant作為sns.FacetGrid()的分面變數,並取消各圖的 x 軸連動,以便讓區間比例合宜。將建立好的區間上下界傳入對應的
plt.hlines()繪圖函式。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Construct CI bounds for averages
average_ests['lower'] = average_ests['____'] - 1.96*average_ests['____']
average_ests['upper'] = average_ests['____'] + 1.96*average_ests['____']
# Setup a grid of plots, with non-shared x axes limits
g = sns.FacetGrid(average_ests, row = '____', ____ = False)
# Plot CI for average estimate
g.map(plt.hlines, 'y', '____', '____')
# Plot observed values for comparison and remove axes labels
g.map(plt.scatter, 'seen', 'y', color = 'orangered').set_ylabels('').set_xlabels('')
plt.show()