เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การกระจายข้อมูลชุดฝึกและชุดทดสอบ

ในการสัมภาษณ์ด้าน machine learning คุณมักต้องทำงานกับข้อมูลชุดฝึกและชุดทดสอบอยู่เสมอ ดังที่กล่าวไปก่อนหน้า หากการกระจายของข้อมูลทั้งสองชุดแตกต่างกันมาก อาจส่งผลให้ประสิทธิภาพของโมเดลลดลงได้

ในแบบฝึกหัดนี้ จะใช้ฟังก์ชันจาก sklearn.model_selection รวมถึง seaborn และ matplotlib.pyplot เพื่อแบ่ง loan_data ออกเป็นชุดฝึกและชุดทดสอบ พร้อมทั้งแสดงภาพการกระจายของข้อมูลเพื่อตรวจหาความแตกต่างที่อาจเกิดขึ้น

ทั้ง seaborn และ matplotlib.pyplot ได้ถูก import ไว้ในพื้นที่ทำงานแล้ว โดยใช้ชื่อย่อว่า sns และ plt ตามลำดับ

ขณะนี้ pipeline ได้เพิ่มขั้นตอน Train/Test split เข้ามาแล้ว:

Machine learning pipeline

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

ฝึกตอบคำถามสัมภาษณ์ Machine Learning ด้วย Python

ดูคอร์ส

คำแนะนำการฝึกหัด

  • กรองข้อมูลใน loan_data ให้เหลือเฉพาะฟีเจอร์ Credit Score และ Annual Income รวมถึงตัวแปรเป้าหมาย Loan Status ตามลำดับนี้
  • แบ่งข้อมูล loan_data ในสัดส่วน 80/20 แล้วกำหนดให้กับ loan_data_subset
  • สร้าง pairplot ของ trainingSet และ testSet (ตามลำดับนี้) โดยตั้งค่าอาร์กิวเมนต์ hue ให้เป็นตัวแปรเป้าหมาย Loan Status

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]

# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)

# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()

plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
แก้ไขและรันโค้ด