現在來使用已訓練完成的隨機森林模型,從輸入資料集 X 中選出最重要的特徵。
X
前一個練習訓練好的模型已為你預先載入為 rf。
rf
本練習屬於課程
試著完成這個範例程式碼,體驗一下這個練習。
# Create a mask for features importances above the threshold mask = ____ # Prints out the mask print(mask)
你將認識降維的概念,並學會何時、為什麼需要降維。你會了解特徵選擇與特徵擷取的差異,並在資料探索中實作這兩種技術。章節最後會介紹 t-SNE,一種強大的特徵擷取技術,能幫你將高維度資料集可視化。
在特徵選擇的兩個章節之首,你會學到維度詛咒,以及降維如何幫助你克服它。你將認識多種技巧,用來偵測並移除對資料集幾乎沒有增益的特徵——可能因為變異很小、遺漏值太多,或與其他特徵高度相關。
在特徵選擇的第二個章節,你將學會如何讓模型協助你找出對預測特定目標特徵最重要的那些特徵。在本章最後一課中,你會綜合多個不同模型的建議,來決定哪些特徵值得保留。
當前練習
本章將深入探討最常用的降維演算法——主成分分析(PCA)。你會建立對此演算法的直覺理解,知道它為何強大,並在資料探索與建模流程的前處理中加以應用。最後,會以影像壓縮的有趣案例作結。