เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

Decision tree

ในสามบทที่ผ่านมา คุณได้เรียนรู้เทคนิคหลากหลายที่ช่วยรับมือกับโจทย์สัมภาษณ์ด้าน machine learning ในหลายมิติ บทนี้จะแนะนำวิธีต่าง ๆ เพื่อให้มั่นใจว่าโมเดลที่สร้างหรือพูดถึงในการสัมภาษณ์นั้นสามารถ generalize ได้ดี ได้รับการประเมินอย่างถูกต้อง และถูกเลือกอย่างเหมาะสมจากโมเดลที่เป็นไปได้ทั้งหมด

ในแบบฝึกหัดนี้ จะได้เจาะลึกการปรับ hyperparameter สำหรับ decision tree บนชุดข้อมูล loan_data โดยจะปรับ min_samples_split ซึ่งคือจำนวนตัวอย่างขั้นต่ำที่จำเป็นสำหรับการแยก binary split เพิ่มเติม และ max_depth ซึ่งกำหนดความลึกของต้นไม้ ต้นไม้ที่ลึกกว่าจะมีการแยกมากขึ้น และจึงดึงข้อมูลได้มากขึ้น

เมทริกซ์ฟีเจอร์ X และ label เป้าหมาย y ถูกนำเข้ามาให้แล้ว

สังเกตว่านี่คือการทำตามขั้นตอนทั้งหมดใน machine learning pipeline อีกครั้ง!

Machine learning pipeline

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

ฝึกตอบคำถามสัมภาษณ์ Machine Learning ด้วย Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Import modules
from sklearn.tree import ____
from sklearn.metrics import accuracy_score

# Train/test split
X_train, X_test, y_train, y_test = train_test_split(____, ____, test_size=0.30, random_state=123)

# Instantiate, Fit, Predict
loans_clf = ____() 
loans_clf.____(____, ____)
y_pred = loans_clf.____(____)

# Evaluation metric
print("Decision Tree Accuracy: {}".format(____(____,____)))
แก้ไขและรันโค้ด