已對房屋銷售資料的子集合執行 PCA。資料在 house_sales_df,包含 8 個特徵。PCA 的結果在 pca_res。請使用 summary() 檢視各主成分所解釋的變異比例。
house_sales_df
pca_res
summary()
要解釋原始資料至少 70% 的變異,你需要多少個主成分?
本練習屬於課程
將理論付諸實踐,立即體驗我們的互動練習
準備好簡化大型資料集吧!你將學到什麼是資訊、如何評估特徵重要度,並實作找出低資訊量的特徵。完成本章後,你會理解特徵選擇與特徵萃取的差異——這是降維的兩種主要方法。
學習如何根據遺漏值比例、變異數與相關性,辨識資訊豐富與資訊不足的特徵。接著,你將了解如何建立 tidymodels 的 recipe,利用這些資訊指標來進行特徵選擇。
第三章將介紹非監督與監督式特徵選擇方法的差異。你會複習如何使用 tidymodels 的 workflow 來建構模型。之後,你將以 lasso 迴歸與隨機森林模型進行監督式特徵選擇。
在最後一章,你將透過理解主成分如何從不同特徵中擷取並結合最關鍵的資訊,建立對特徵萃取的直覺。接著學習並實作三種特徵萃取方法——主成分分析(PCA)、t-SNE 與 UMAP。了解如何在 tidymodels 的模型建構流程中,將這些特徵萃取方法作為前處理步驟使用。
當前練習