特徵選擇主要分為兩大類——監督式與非監督式。在這個練習中,你要將具體的特徵選擇方法對應到它們的類型。監督式特徵選擇需要提供訓練標籤的目標變數。
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
準備好簡化大型資料集吧!你將學到什麼是資訊、如何評估特徵重要度,並實作找出低資訊量的特徵。完成本章後,你會理解特徵選擇與特徵萃取的差異——這是降維的兩種主要方法。
學習如何根據遺漏值比例、變異數與相關性,辨識資訊豐富與資訊不足的特徵。接著,你將了解如何建立 tidymodels 的 recipe,利用這些資訊指標來進行特徵選擇。
第三章將介紹非監督與監督式特徵選擇方法的差異。你會複習如何使用 tidymodels 的 workflow 來建構模型。之後,你將以 lasso 迴歸與隨機森林模型進行監督式特徵選擇。
當前練習
在最後一章,你將透過理解主成分如何從不同特徵中擷取並結合最關鍵的資訊,建立對特徵萃取的直覺。接著學習並實作三種特徵萃取方法——主成分分析(PCA)、t-SNE 與 UMAP。了解如何在 tidymodels 的模型建構流程中,將這些特徵萃取方法作為前處理步驟使用。