เทคนิคการจัดการ Multicollinearity - PCA
ในแบบฝึกหัดที่แล้ว คุณใช้ feature engineering เพื่อรวมตัวแปรอิสระ s1 และ s2 เข้าด้วยกันเป็น s1_s2 เนื่องจากทั้งสองมีค่าความสัมพันธ์สูงที่สุดในชุดข้อมูล diabetes
ในแบบฝึกหัดนี้ คุณจะนำ PCA มาใช้กับชุดข้อมูล diabetes เพื่อกำจัด multicollinearity ก่อนนำ Linear Regression มาประยุกต์ใช้ จากนั้นจะเปรียบเทียบค่าเมตริกผลลัพธ์กับแบบฝึกหัดที่แล้ว และสุดท้ายจะแสดงภาพ correlation matrix และ heatmap ของชุดข้อมูลหลังจากที่ PCA กำจัด multicollinearity ออกไปอย่างสมบูรณ์
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ฝึกตอบคำถามสัมภาษณ์ Machine Learning ด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import
from sklearn.decomposition import ____
# Instantiate
pca = ____()
# Fit on train
pca.____(____)
# Transform train and test
X_trainPCA = pca.____(____)
X_testPCA = pca.____(____)