你想使用 wine 資料集中的 Ash、Alcalinity of ash,以及 Magnesium 欄位來訓練線性模型,但這些欄位可能採用不同的量測方式,會讓線性模型產生偏誤。
wine
Ash
Alcalinity of ash
Magnesium
以下哪一個關於這些欄位的敘述是正確的?
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
在本章中,你會確切了解什麼是資料前處理。你會從前處理的第一步開始,包括探索資料型別與處理遺漏值。
本章重點在資料標準化。許多模型會對特徵的分佈或尺度有假設。標準化能讓資料符合這些假設,並提升演算法的效能。
當前練習
本章將帶你認識特徵工程。你會探索多種方法,從現有特徵中建立新的、更加有用的特徵。你將學會如何對數值與文字特徵進行編碼、聚合,以及萃取資訊。
本章介紹多種從資料集中挑選最重要特徵的技巧。你會學到如何移除冗餘特徵、處理文字向量,並使用主成分分析(PCA)降低資料集中的特徵數量。
現在你已經學會前處理相關技巧,將把這些方法套用到一個記錄 UFO 目擊資訊的資料集上。