Decision tree
ในสามบทที่ผ่านมา คุณได้เรียนรู้เทคนิคหลากหลายที่ช่วยรับมือกับโจทย์สัมภาษณ์ด้าน machine learning ในหลายมิติ บทนี้จะแนะนำวิธีต่าง ๆ เพื่อให้มั่นใจว่าโมเดลที่สร้างหรือพูดถึงในการสัมภาษณ์นั้นสามารถ generalize ได้ดี ได้รับการประเมินอย่างถูกต้อง และถูกเลือกอย่างเหมาะสมจากโมเดลที่เป็นไปได้ทั้งหมด
ในแบบฝึกหัดนี้ จะได้เจาะลึกการปรับ hyperparameter สำหรับ decision tree บนชุดข้อมูล loan_data
โดยจะปรับ min_samples_split ซึ่งคือจำนวนตัวอย่างขั้นต่ำที่จำเป็นสำหรับการแยก binary split เพิ่มเติม และ max_depth ซึ่งกำหนดความลึกของต้นไม้ ต้นไม้ที่ลึกกว่าจะมีการแยกมากขึ้น และจึงดึงข้อมูลได้มากขึ้น
เมทริกซ์ฟีเจอร์ X และ label เป้าหมาย y ถูกนำเข้ามาให้แล้ว
สังเกตว่านี่คือการทำตามขั้นตอนทั้งหมดใน machine learning pipeline อีกครั้ง!

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ฝึกตอบคำถามสัมภาษณ์ Machine Learning ด้วย Python
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import modules
from sklearn.tree import ____
from sklearn.metrics import accuracy_score
# Train/test split
X_train, X_test, y_train, y_test = train_test_split(____, ____, test_size=0.30, random_state=123)
# Instantiate, Fit, Predict
loans_clf = ____()
loans_clf.____(____, ____)
y_pred = loans_clf.____(____)
# Evaluation metric
print("Decision Tree Accuracy: {}".format(____(____,____)))