การแบ่ง Train/Test + การคำนวณความแม่นยำ
ถึงเวลาฝึกแบ่งข้อมูลออกเป็นชุด training และชุด test โดยใช้ชุดข้อมูล churn_df กันแล้ว!
มีการสร้าง NumPy arrays ไว้ให้แล้ว โดย X เก็บ features และ y เก็บตัวแปรเป้าหมาย
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Supervised Learning ด้วย scikit-learn
คำแนะนำการฝึกหัด
- Import
train_test_splitจากsklearn.model_selection - แบ่ง
Xและyออกเป็นชุด training และชุด test โดยกำหนดtest_sizeเป็น 20%,random_stateเป็น42และให้สัดส่วนของ label เป้าหมายสะท้อนชุดข้อมูลต้นฉบับ - Fit โมเดล
knnกับข้อมูล training - คำนวณและแสดงผลความแม่นยำของโมเดลบนข้อมูล test
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Import the module
from ____ import ____
X = churn_df.drop("churn", axis=1).values
y = churn_df["churn"].values
# Split into training and test sets
X_train, X_test, y_train, y_test = ____(____, ____, test_size=____, random_state=____, stratify=____)
knn = KNeighborsClassifier(n_neighbors=5)
# Fit the classifier to the training data
____
# Print the accuracy
print(knn.score(____, ____))