ช่วงความเชื่อมั่น 90, 95 และ 99%
คุณเป็นนักวิทยาศาสตร์ข้อมูลให้กับบริษัทท่องเที่ยวผจญภัยกลางแจ้งในเมืองแฟร์แบงก์ส รัฐอลาสก้า ช่วงนี้ลูกค้าเริ่มประสบปัญหาจากมลพิษ SO2 ซึ่งส่งผลให้ต้องยกเลิกทัวร์บ่อยครั้งและสูญเสียรายได้ บริษัทมีเซ็นเซอร์วัดค่า CO, NO2 และ O3 แต่ยังไม่มีเซ็นเซอร์สำหรับ SO2
คุณได้สร้างโมเดลที่ทำนายค่า SO2 จากค่าของสารมลพิษที่มีเซ็นเซอร์อยู่ (โหลดไว้เป็น pollution_model ซึ่งเป็น object ของ statsmodels) และต้องการตรวจสอบว่าสารมลพิษชนิดใดมีผลต่อการทำนาย SO2 ของโมเดลมากที่สุด เพื่อให้รู้ว่าควรติดตามค่าของสารชนิดใดเป็นพิเศษในการวางแผนทัวร์กลางแจ้ง นอกจากนี้ เพื่อให้รายงานมีข้อมูลครบถ้วนที่สุด ให้แสดงความไม่แน่นอนของค่าประมาณจากโมเดลในหลายระดับ
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การพัฒนาการแสดงผลข้อมูลใน Python
คำแนะนำการฝึกหัด
- ระบุความกว้างของช่วงความเชื่อมั่นที่เหมาะสม (จาก 90, 95 และ 99%) ให้ตรงกับค่าที่กำหนดไว้ใน
alpha - ภายใน for loop ให้กำหนดสีของช่วงตาม
colorที่ถูกกำหนดไว้ - ส่งค่าเปอร์เซ็นต์
widthของแต่ละรอบลูปไปยังplt.hlines()เพื่อใส่ป้ายกำกับในเลเจนด์
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Add interval percent widths
alphas = [ 0.01, 0.05, 0.1]
widths = [ '__% CI', '__%', '__%']
colors = ['#fee08b','#fc8d59','#d53e4f']
for alpha, color, width in zip(alphas, colors, widths):
# Grab confidence interval
conf_ints = pollution_model.conf_int(alpha)
# Pass current interval color and legend label to plot
plt.hlines(y = conf_ints.index, xmin = conf_ints[0], xmax = conf_ints[1],
colors = ____, ____ = width, linewidth = 10)
# Draw point estimates
plt.plot(pollution_model.params, pollution_model.params.index, 'wo', label = 'Point Estimate')
plt.legend()
plt.show()