還記得信用資料集嗎?既然你現在更了解各種指標,就再來看看隨機森林在這個資料集上的表現如何。你已經訓練好分類器,並在測試資料上得到混淆矩陣。測試資料與結果已提供為 tp、fp、fn、tn,分別代表真正例、假正例、假負例與真負例。你也有測試資料的真實標籤 y_test,以及模型的預測標籤 preds。此外,f1_score() 與 precision_score() 也已匯入可用。
tp
fp
fn
tn
y_test
preds
f1_score()
precision_score()
本練習屬於課程
試著完成這個範例程式碼,體驗一下這個練習。
print(____(____, preds))
本章將帶你複習監督式學習的標準工作流程,涵蓋模型擬合、調校與選擇、特徵工程與選擇,以及資料切分技巧。你會了解流程中各步驟彼此的依存關係,並辨識它們如何共同抑制或加劇過度擬合——資料科學家最頭痛的問題。完成本章後,你將熟練掌握監督式學習,並準備好在後續章節挑戰更進階的主題。
在上一章中,你已經熟悉標準的監督式學習流程。本章將批判性地檢視如何將專家知識融入監督式學習。方法包括:辨識合適的分析單位(可能需要跨多個資料來源進行特徵工程)、面對不完美的樣本標註流程,以及訂定能反映商業價值、捕捉模型錯誤真實成本的損失函式。
當前練習
在上一章中,你以多種方式把專家回饋納入工作流程,並用與商業價值一致的方式進行評估。現在,該是實作將模型產品化的技能,並透過持續迭代來確保模型日後仍維持良好表現。你也會學到如何診斷資料集移轉,並緩解環境變化對模型準確度的影響。
前幾章中,你已為監督式學習打下穩固基礎,並學會將模型部署到生產環境,但一直假設分析可取得有標籤的資料集。本章要挑戰的是在沒有或僅有極少標籤的情況下進行建模。你將探索異常偵測這類非監督式模型,以及以距離為基礎的學習方法,利用對「兩個樣本何謂相似」的判斷來取代標籤,達到可與監督式流程相當的準確度。完成本章後,你將清楚知道如何調整工作流程,來克服常見的真實世界難題,並在資料科學家中脫穎而出。