การ Centering และ Scaling สำหรับ Regression
เมื่อเห็นประโยชน์ของการ scale ข้อมูลแล้ว คราวนี้จะใช้ pipeline เพื่อประมวลผลฟีเจอร์ใน music_df และสร้างโมเดล lasso regression สำหรับพยากรณ์ความดังของเพลง
X_train, X_test, y_train และ y_test ถูกสร้างขึ้นจากชุดข้อมูล music_df โดยมี "loudness" เป็น target และคอลัมน์อื่น ๆ ทั้งหมดเป็นฟีเจอร์ นอกจากนี้ยังได้ import Lasso และ Pipeline ไว้ให้แล้ว
หมายเหตุ: "genre" ถูกแปลงเป็นฟีเจอร์แบบ binary โดยค่า 1 หมายถึงเพลงร็อค และค่า 0 หมายถึงแนวเพลงอื่น ๆ
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Supervised Learning ด้วย scikit-learn
คำแนะนำการฝึกหัด
- Import
StandardScaler - สร้าง steps สำหรับ pipeline โดยประกอบด้วย
StandardScalerobject ที่ตั้งชื่อว่า"scaler"และโมเดล lasso ที่ตั้งชื่อว่า"lasso"โดยกำหนดalphaเป็น0.5 - Instantiate pipeline ที่มี steps สำหรับการ scale ข้อมูลและสร้างโมเดล lasso regression
- คำนวณค่า R-squared บนข้อมูลทดสอบ
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import StandardScaler
____
# Create pipeline steps
steps = [("____", ____()),
("____", ____(alpha=____))]
# Instantiate the pipeline
pipeline = ____(____)
pipeline.fit(X_train, y_train)
# Calculate and print R-squared
print(____.____(____, ____))