or
本練習屬於課程
本章將帶你複習監督式學習的標準工作流程,涵蓋模型擬合、調校與選擇、特徵工程與選擇,以及資料切分技巧。你會了解流程中各步驟彼此的依存關係,並辨識它們如何共同抑制或加劇過度擬合——資料科學家最頭痛的問題。完成本章後,你將熟練掌握監督式學習,並準備好在後續章節挑戰更進階的主題。
當前練習
在上一章中,你已經熟悉標準的監督式學習流程。本章將批判性地檢視如何將專家知識融入監督式學習。方法包括:辨識合適的分析單位(可能需要跨多個資料來源進行特徵工程)、面對不完美的樣本標註流程,以及訂定能反映商業價值、捕捉模型錯誤真實成本的損失函式。
在上一章中,你以多種方式把專家回饋納入工作流程,並用與商業價值一致的方式進行評估。現在,該是實作將模型產品化的技能,並透過持續迭代來確保模型日後仍維持良好表現。你也會學到如何診斷資料集移轉,並緩解環境變化對模型準確度的影響。
前幾章中,你已為監督式學習打下穩固基礎,並學會將模型部署到生產環境,但一直假設分析可取得有標籤的資料集。本章要挑戰的是在沒有或僅有極少標籤的情況下進行建模。你將探索異常偵測這類非監督式模型,以及以距離為基礎的學習方法,利用對「兩個樣本何謂相似」的判斷來取代標籤,達到可與監督式流程相當的準確度。完成本章後,你將清楚知道如何調整工作流程,來克服常見的真實世界難題,並在資料科學家中脫穎而出。