or
本練習屬於課程
原始資料並不一定最適合直接分析。在本章開頭,你將先了解如何轉換與建立特徵,以提升模型的效能與可解釋性。
在本章中,你會學到,除了手動轉換特徵之外,還能運用 tidyverse 的工具以程式化方式打造新變數。你將探討這種作法如何提升模型的可重現性,並在處理含有大量特徵的資料集時特別有用。
當前練習
接下來你將學到,模型常能從降維與自高維資料中擷取特徵而受益,包括將文字資料轉為數值、編碼類別資料,以及為變數排序其預測力。你將探索的方法包含主成分分析、核主成分分析、從文字擷取數值、類別編碼,以及變數重要度分數。
你將在最後一章結合特徵工程與機器學習技巧。你會先聚焦於在模型中使用所有可用特徵所帶來的問題,以及辨識無關與冗餘特徵的重要性,並學習使用嵌入式方法(如 lasso 與 elastic-net)移除這些特徵。接著,你會探索縮減方法,例如 lasso、ridge 與 elastic-net,可用來正規化特徵權重,或將係數設為 0 以進行特徵選擇。最後,你將建立端到端的特徵工程工作流程,並在一個小型專案中複習與練習先前學到的觀念與函式。