การกระจายข้อมูลชุดฝึกและชุดทดสอบ
ในการสัมภาษณ์ด้าน machine learning คุณมักต้องทำงานกับข้อมูลชุดฝึกและชุดทดสอบอยู่เสมอ ดังที่กล่าวไปก่อนหน้า หากการกระจายของข้อมูลทั้งสองชุดแตกต่างกันมาก อาจส่งผลให้ประสิทธิภาพของโมเดลลดลงได้
ในแบบฝึกหัดนี้ จะใช้ฟังก์ชันจาก sklearn.model_selection รวมถึง seaborn และ matplotlib.pyplot เพื่อแบ่ง loan_data ออกเป็นชุดฝึกและชุดทดสอบ พร้อมทั้งแสดงภาพการกระจายของข้อมูลเพื่อตรวจหาความแตกต่างที่อาจเกิดขึ้น
ทั้ง seaborn และ matplotlib.pyplot ได้ถูก import ไว้ในพื้นที่ทำงานแล้ว โดยใช้ชื่อย่อว่า sns และ plt ตามลำดับ
ขณะนี้ pipeline ได้เพิ่มขั้นตอน Train/Test split เข้ามาแล้ว:

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ฝึกตอบคำถามสัมภาษณ์ Machine Learning ด้วย Python
คำแนะนำการฝึกหัด
- กรองข้อมูลใน
loan_dataให้เหลือเฉพาะฟีเจอร์Credit ScoreและAnnual Incomeรวมถึงตัวแปรเป้าหมายLoan Statusตามลำดับนี้ - แบ่งข้อมูล
loan_dataในสัดส่วน 80/20 แล้วกำหนดให้กับloan_data_subset - สร้าง pairplot ของ
trainingSetและtestSet(ตามลำดับนี้) โดยตั้งค่าอาร์กิวเมนต์hueให้เป็นตัวแปรเป้าหมายLoan Status
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Create `loan_data` subset: loan_data_subset
loan_data_subset = ____[['____','____','____']]
# Create train and test sets
trainingSet, testSet = ____(____, ____=___, random_state=123)
# Examine pairplots
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()
plt.figure()
sns.____(____, hue='____', palette='RdBu')
plt.show()