90%、95%、99% の区間
あなたはアラスカ州フェアバンクスにあるアウトドア・アドベンチャー企業のデータサイエンティストです。最近、SO2(二酸化硫黄)汚染によって顧客に不便が生じ、高額なキャンセルが発生しています。同社には CO、NO2、O3 のセンサーはありますが、SO2 のセンサーはありません。
そこで、センサーのある汚染物質の値に基づいて SO2 の値を予測するモデル(pollution_model、statsmodels オブジェクト)を作成しました。どの汚染物質の値がモデルの SO2 予測に最も大きな影響を与えるかを調べたいと考えています。これにより、屋外ツアーを計画する際に、どの汚染物質の値に最も注意を払うべきかが分かります。レポートの情報量を最大化するために、モデル推定に対して複数レベルの不確実性を示してください。
この演習はコースの一部です
Pythonでデータ可視化を磨く
演習の手順
alphaの値リストに合わせて、該当する区間幅のパーセント(90%、95%、99%)を入力します。- for ループ内で、指定された
colorで区間に色を付けます。 - ループの
width(パーセント)値をplt.hlines()に渡し、凡例のラベルに使ってください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Add interval percent widths
alphas = [ 0.01, 0.05, 0.1]
widths = [ '__% CI', '__%', '__%']
colors = ['#fee08b','#fc8d59','#d53e4f']
for alpha, color, width in zip(alphas, colors, widths):
# Grab confidence interval
conf_ints = pollution_model.conf_int(alpha)
# Pass current interval color and legend label to plot
plt.hlines(y = conf_ints.index, xmin = conf_ints[0], xmax = conf_ints[1],
colors = ____, ____ = width, linewidth = 10)
# Draw point estimates
plt.plot(pollution_model.params, pollution_model.params.index, 'wo', label = 'Point Estimate')
plt.legend()
plt.show()