เทคนิคการจัดการ Multicollinearity - Feature Engineering
Multicollinearity เป็นปัญหาที่พบได้บ่อยและอาจส่งผลต่อประสิทธิภาพของโมเดล machine learning การอธิบายประเด็นนี้ได้อย่างชัดเจนจะช่วยยกระดับคำตอบในการสัมภาษณ์จากดีเป็นดีเยี่ยม
ในแบบฝึกหัดนี้ จะฝึกสร้างโมเดล baseline โดยใช้ Linear Regression กับชุดข้อมูล diabetes และสำรวจเมตริกผลลัพธ์บางส่วน จากนั้นจะฝึกใช้เทคนิคการสำรวจความสัมพันธ์ระหว่างตัวแปรอิสระด้วยภาพ ก่อนที่จะทำ feature engineering กับตัวแปร 2 ตัวที่มีความสัมพันธ์สูง
สำหรับสองขั้นตอนแรก ให้ใช้ X_train, X_test, y_train และ y_test ที่นำเข้ามาใน workspace แล้ว
นอกจากนี้ แพ็กเกจที่จำเป็นทั้งหมดได้ถูกนำเข้าให้แล้ว ได้แก่:
pandas เป็น pd, train_test_split จาก sklearn.model_selection, LinearRegression จาก sklearn.linear_model, mean_squared_error และ r2_score จาก sklearn.metrics, matplotlib.pyplot เป็น plt และ seaborn เป็น sns.
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ฝึกตอบคำถามสัมภาษณ์ Machine Learning ด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)
# Coefficient estimates
print('Coefficients: \n', lin_mod.____)
# Mean squared error
print("Mean squared error: %.2f"
% ____(____, ____))
# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))