เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

เทคนิคการจัดการ Multicollinearity - Feature Engineering

Multicollinearity เป็นปัญหาที่พบได้บ่อยและอาจส่งผลต่อประสิทธิภาพของโมเดล machine learning การอธิบายประเด็นนี้ได้อย่างชัดเจนจะช่วยยกระดับคำตอบในการสัมภาษณ์จากดีเป็นดีเยี่ยม

ในแบบฝึกหัดนี้ จะฝึกสร้างโมเดล baseline โดยใช้ Linear Regression กับชุดข้อมูล diabetes และสำรวจเมตริกผลลัพธ์บางส่วน จากนั้นจะฝึกใช้เทคนิคการสำรวจความสัมพันธ์ระหว่างตัวแปรอิสระด้วยภาพ ก่อนที่จะทำ feature engineering กับตัวแปร 2 ตัวที่มีความสัมพันธ์สูง

สำหรับสองขั้นตอนแรก ให้ใช้ X_train, X_test, y_train และ y_test ที่นำเข้ามาใน workspace แล้ว

นอกจากนี้ แพ็กเกจที่จำเป็นทั้งหมดได้ถูกนำเข้าให้แล้ว ได้แก่: pandas เป็น pd, train_test_split จาก sklearn.model_selection, LinearRegression จาก sklearn.linear_model, mean_squared_error และ r2_score จาก sklearn.metrics, matplotlib.pyplot เป็น plt และ seaborn เป็น sns.

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

ฝึกตอบคำถามสัมภาษณ์ Machine Learning ด้วย Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Instantiate, fit, predict
lin_mod = ____()
lin_mod.____(____, ____)
y_pred = lin_mod.____(____)

# Coefficient estimates
print('Coefficients: \n', lin_mod.____)

# Mean squared error
print("Mean squared error: %.2f"
      % ____(____, ____))

# Explained variance score
print('R_squared score: %.2f' % ____(____, ____))
แก้ไขและรันโค้ด