เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

วิธีการกรองและ Wrapper

คำถามเกี่ยวกับการลดมิติของชุดข้อมูลเป็นหัวข้อที่พบบ่อยมากในการสัมภาษณ์ด้าน Machine Learning หนึ่งในวิธีลดมิติคือการเลือกเฉพาะฟีเจอร์ที่เกี่ยวข้องจากชุดข้อมูล

ในแบบฝึกหัดนี้ จะได้ฝึกใช้ filter method กับ DataFrame diabetes จากนั้นนำ wrapper method 2 รูปแบบที่รวม cross-validation มาใช้ด้วย โดยจะใช้ pandas, matplotlib.pyplot และ seaborn เพื่อแสดงภาพความสัมพันธ์ ประมวลผลข้อมูล และนำเทคนิคการเลือกฟีเจอร์ไปใช้กับชุดข้อมูล

เมทริกซ์ฟีเจอร์ที่ตัดคอลัมน์ตัวแปรเป้าหมาย (progression) ออกแล้วจะถูกโหลดเป็น X ส่วนตัวแปรเป้าหมายจะถูกโหลดเป็น y

โปรดทราบว่า pandas, matplotlib.pyplot และ seaborn ได้ถูก import ไว้ใน workspace แล้ว และกำหนด alias เป็น pd, plt และ sns ตามลำดับ

สังเกตว่าได้เพิ่มขั้นตอน Cross-validate เข้าไปใน pipeline แล้ว (ซึ่งครอบคลุม 3 ขั้นตอนสุดท้าย):

Machine learning pipeline

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

ฝึกตอบคำถามสัมภาษณ์ Machine Learning ด้วย Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create correlation matrix and print it
cor = ____.____()
print(____)

# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()

# Correlation with output variable
cor_target = abs(cor["progression"])

# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)
แก้ไขและรันโค้ด