探索相關的預測變數
彼此相關的預測變數會提供重複的資訊,並可能負面影響模型擬合過程。當兩個變數高度相關時,它們的數值會彼此呈線性變化,因此對你的機器學習演算法提供的是相同的訊息。這種現象稱為多重共線性(multicollinearity)。
在開始模型擬合之前,先探索資料集以找出這些關係,並在特徵工程步驟中將其移除,十分重要。
在本練習中,你將透過建立所有數值型預測變數的相關係數矩陣來探索 telecom_training 資料集。
telecom_training 資料已載入你的工作階段。
本練習屬於課程
在 R 中使用 tidymodels 建立模型
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
telecom_training %>%
# Select numeric columns
___(___) %>%
# Calculate correlation matrix
___