ฝึกสร้าง classification tree ต้นแรก
ในแบบฝึกหัดนี้ จะได้ทำงานกับ Wisconsin Breast Cancer Dataset จาก UCI machine learning repository โดยจะพยากรณ์ว่าเนื้องอกนั้นเป็นมะเร็ง (malignant) หรือไม่ร้ายแรง (benign) โดยอาศัย 2 feature ได้แก่ รัศมีเฉลี่ยของเนื้องอก (radius_mean) และจำนวนจุดเว้าเฉลี่ย (concave points_mean)
ชุดข้อมูลถูกโหลดไว้ใน workspace แล้ว และแบ่งออกเป็นชุด training 80% และชุด test 20% โดย feature matrix ถูกกำหนดให้กับ X_train และ X_test ส่วน array ของ label ถูกกำหนดให้กับ y_train และ y_test ซึ่ง class 1 หมายถึงเนื้องอกที่เป็นมะเร็ง และ class 0 หมายถึงเนื้องอกที่ไม่ร้ายแรง นอกจากนี้ยังได้กำหนดตัวแปร SEED ไว้เป็น 1 เพื่อให้ผลลัพธ์สามารถทำซ้ำได้
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Learning with Tree-Based Models in Python
คำแนะนำการฝึกหัด
Import
DecisionTreeClassifierจากsklearn.treeสร้าง
DecisionTreeClassifierชื่อdtโดยกำหนดความลึกสูงสุดเป็น 6Fit
dtกับชุดข้อมูล trainingพยากรณ์ label ของชุดข้อมูล test และกำหนดผลลัพธ์ให้กับ
y_pred
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import DecisionTreeClassifier from sklearn.tree
from ____.____ import ____
# Instantiate a DecisionTreeClassifier 'dt' with a maximum depth of 6
dt = ____(____=____, random_state=SEED)
# Fit dt to the training set
____.____(____, ____)
# Predict test set labels
y_pred = ____.____(____)
print(y_pred[0:5])