การวิเคราะห์องค์ประกอบหลัก (Principal Component Analysis)
ใน 2 บทที่ผ่านมา คุณได้เห็นตัวอย่างต่าง ๆ ของการลดมิติข้อมูล ไม่ว่าจะเป็น Regularization และการคัดเลือกฟีเจอร์ การอธิบายแนวทางลดมิติข้อมูลในรูปแบบต่าง ๆ ได้นั้นถือเป็นทักษะสำคัญสำหรับการสัมภาษณ์ด้าน Machine Learning ชุดข้อมูลขนาดใหญ่ใช้เวลาประมวลผลนาน และ Noise ในข้อมูลอาจทำให้ผลลัพธ์คลาดเคลื่อนได้
วิธีหนึ่งในการลดมิติข้อมูลคือ Principal Component Analysis ซึ่งเป็นเทคนิคที่มีประสิทธิภาพในการลดขนาดข้อมูลโดยสร้างฟีเจอร์ใหม่ที่เก็บรักษาข้อมูลสำคัญไว้ และยังช่วยแก้ปัญหา Multicollinearity ได้ด้วย ในแบบฝึกหัดนี้ จะใช้โมดูล sklearn.decomposition เพื่อทำ PCA บนฟีเจอร์ของชุดข้อมูล diabetes โดยแยกตัวแปรเป้าหมาย progression ออกมา
นี่คือตำแหน่งปัจจุบันในขั้นตอน Pipeline:

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ฝึกตอบคำถามสัมภาษณ์ Machine Learning ด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import module
from ____.____ import ____
# Feature matrix and target array
X = ____.____('____', axis=1)
y = ____['____']