多重共線性技巧-特徵工程
多重共線性是在各種機器學習情境中常見、且可能影響模型效能的議題。能清楚說明這個細節,會讓你對模型的解釋從不錯提升到更到位,並在面試中脫穎而出。
在這個練習中,你將先使用 diabetes 資料集以線性迴歸建立基準模型,並探索部分輸出評估指標。接著,你會練習以視覺化方式檢視自變數之間的相關性,最後對兩個高度相關的變數進行特徵工程。
在前兩個步驟中,請使用已匯入工作環境的 X_train、X_test、y_train 和 y_test。
此外,所有相關套件都已為你匯入:pandas 作為 pd、sklearn.model_selection 的 train_test_split、sklearn.linear_model 的 LinearRegression、sklearn.metrics 的 mean_squared_error 與 r2_score,以及 matplotlib.pyplot 作為 plt 和 seaborn 作為 sns。
本練習屬於課程
用 Python 練習機器學習面試題
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)
# Coefficient estimates
print('Coefficients: \n', lin_mod.____)
# Mean squared error
print("Mean squared error: %.2f"
% ____(____, ____))
# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))