เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การจัดการค่า Outlier

ในแบบฝึกหัดที่ผ่านมา คุณได้เรียนรู้ว่าการแสดงภาพค่า Outlier มีประโยชน์อย่างไรในการสัมภาษณ์งานด้าน Machine Learning อีกวิธีที่สะดวกในการจัดการค่า Outlier คือการคำนวณ Z-score ซึ่งใช้กำหนดเกณฑ์สำหรับค่า Outlier ที่อยู่ห่างจากค่าเฉลี่ยประมาณ +/-3 ส่วนเบี่ยงเบนมาตรฐาน

ในแบบฝึกหัดนี้ จะใช้โมดูล scipy.stats เพื่อคำนวณ Z-score ด้วยฟังก์ชัน stats.zscore() และใช้ฟังก์ชัน mstats.winsorize() เพื่อแทนที่ค่า Outlier ด้วยเทคนิคที่เรียกว่า Winsorizing

จากวิดีโอบทเรียน จุดข้อมูลที่อยู่เหนือหรือต่ำกว่า 1.5 เท่าของ IQR ควรถูกพิจารณาว่าเป็น Outlier ที่น่าสงสัย สำหรับขั้นตอนสุดท้ายของแบบฝึกหัดนี้ ค่าดังกล่าวคือ 2120

แพ็กเกจที่เกี่ยวข้องได้ถูก import ให้แล้ว และคอลัมน์ตัวเลขกับคอลัมน์หมวดหมู่ของ loan_data ได้ถูกแยกและบันทึกไว้เป็น numeric_cols และ categoric_cols ตามลำดับ

Machine learning pipeline

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

ฝึกตอบคำถามสัมภาษณ์ Machine Learning ด้วย Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Print: before dropping
print(numeric_cols.mean())
print(numeric_cols.median())
print(numeric_cols.max())

# Create index of rows to keep
idx = (np.____(stats.____(____)) < 3).all(axis=1)

# Concatenate numeric and categoric subsets
ld_out_drop = pd.concat([numeric_cols.loc[____], categoric_cols.loc[____]], axis=1)

# Print: after dropping
print(ld_out_drop.mean())
print(ld_out_drop.median())
print(ld_out_drop.max())
แก้ไขและรันโค้ด