วิธีการกรองและ Wrapper
คำถามเกี่ยวกับการลดมิติของชุดข้อมูลเป็นหัวข้อที่พบบ่อยมากในการสัมภาษณ์ด้าน Machine Learning หนึ่งในวิธีลดมิติคือการเลือกเฉพาะฟีเจอร์ที่เกี่ยวข้องจากชุดข้อมูล
ในแบบฝึกหัดนี้ จะได้ฝึกใช้ filter method กับ DataFrame diabetes จากนั้นนำ wrapper method 2 รูปแบบที่รวม cross-validation มาใช้ด้วย โดยจะใช้ pandas, matplotlib.pyplot และ seaborn เพื่อแสดงภาพความสัมพันธ์ ประมวลผลข้อมูล และนำเทคนิคการเลือกฟีเจอร์ไปใช้กับชุดข้อมูล
เมทริกซ์ฟีเจอร์ที่ตัดคอลัมน์ตัวแปรเป้าหมาย (progression) ออกแล้วจะถูกโหลดเป็น X ส่วนตัวแปรเป้าหมายจะถูกโหลดเป็น y
โปรดทราบว่า pandas, matplotlib.pyplot และ seaborn ได้ถูก import ไว้ใน workspace แล้ว และกำหนด alias เป็น pd, plt และ sns ตามลำดับ
สังเกตว่าได้เพิ่มขั้นตอน Cross-validate เข้าไปใน pipeline แล้ว (ซึ่งครอบคลุม 3 ขั้นตอนสุดท้าย):

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ฝึกตอบคำถามสัมภาษณ์ Machine Learning ด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create correlation matrix and print it
cor = ____.____()
print(____)
# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()
# Correlation with output variable
cor_target = abs(cor["progression"])
# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)