เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การแปลงค่าด้วย Log และ Power

ในแบบฝึกหัดที่แล้ว คุณได้เปรียบเทียบการกระจายตัวของชุดข้อมูลฝึกสอนและชุดข้อมูลทดสอบของ loan_data ประเด็นนี้สำคัญมากในการสัมภาษณ์ด้าน Machine Learning เพราะการกระจายตัวที่สังเกตได้จะเป็นตัวกำหนดว่าจำเป็นต้องใช้เทคนิคปรับการกระจายตัวของฟีเจอร์ให้เข้าใกล้การแจกแจงแบบปกติ (normal distribution) หรือไม่ เพื่อไม่ให้ละเมิดข้อสมมติเรื่อง normality

ในแบบฝึกหัดนี้ จะใช้การแปลงค่าแบบ log และ power จากโมดูล scipy.stats กับฟีเจอร์ Years of Credit History ของ loan_data ร่วมกับฟังก์ชัน distplot() จาก seaborn ซึ่งพล็อตทั้งการกระจายตัวและการประมาณค่าความหนาแน่นของเคอร์เนล (kernel density estimation)

ได้ import แพ็กเกจที่จำเป็นทั้งหมดให้แล้ว

นี่คือตำแหน่งปัจจุบันใน pipeline:

Machine learning pipeline

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

ฝึกตอบคำถามสัมภาษณ์ Machine Learning ด้วย Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Subset loan_data
cr_yrs = ____['____']

# Histogram and kernel density estimate
plt.figure()
sns.____(____)
plt.show()
แก้ไขและรันโค้ด