or
本練習屬於課程
在本章中,你會確切了解什麼是資料前處理。你會從前處理的第一步開始,包括探索資料型別與處理遺漏值。
本章重點在資料標準化。許多模型會對特徵的分佈或尺度有假設。標準化能讓資料符合這些假設,並提升演算法的效能。
本章將帶你認識特徵工程。你會探索多種方法,從現有特徵中建立新的、更加有用的特徵。你將學會如何對數值與文字特徵進行編碼、聚合,以及萃取資訊。
本章介紹多種從資料集中挑選最重要特徵的技巧。你會學到如何移除冗餘特徵、處理文字向量,並使用主成分分析(PCA)降低資料集中的特徵數量。
當前練習
現在你已經學會前處理相關技巧,將把這些方法套用到一個記錄 UFO 目擊資訊的資料集上。