給定一張散佈圖,選出最能貼合資料的線性模型。
若要測試你的答案,使用預先定義的函式 plot_possible_answer(answer="X") 來繪出各個答案,其中 X 為 A–E 的其中一個。
plot_possible_answer(answer="X")
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
我們先從線性關係的初步探索開始,包含線性模型如何被使用的動機範例,以及來自 matplotlib 的資料視覺化方法示範。接著使用描述統計量化資料的形狀,並以相關係數量化兩個變數間線性關係的強度。
本章將說明建立線性模型所需的各個組成。以泰勒級數的概念為基礎,我們聚焦在斜率與截距這兩個參數,說明它們如何定義模型,以及在多種情境下要如何解讀。我們會運用多種 Python 模組,透過最小平方法,計算使斜率與截距最合適的數值,並使用 numpy、statsmodels 與 scikit-learn 找到最貼合資料的模型。
當前練習
接下來你會把模型用在真實資料上並進行預測。我們會探討預測最常見的陷阱與限制,並以多種配適度指標(包含 RMSE 與 R-squared)來量化與比較模型表現。
最後一章將介紹推論統計的概念,並用這些概念說明如何利用最大概似估計與 bootstrap 重抽樣來估計線性模型參數。接著我們套用這些方法,對模型參數的可信度做出機率式的敘述。