Logistic Regression สำหรับมะเร็งเต้านม
ในแบบฝึกหัดที่แล้ว เราได้ทำการประเมินข้อมูลเบื้องต้นไปแล้ว ในแบบฝึกหัดนี้ จะได้กำหนดชุดข้อมูลสำหรับการฝึกและการทดสอบโมเดล Logistic Regression บนชุดข้อมูลมะเร็งเต้านม ซึ่งเป็นขั้นตอนแรกที่สำคัญในการรันโมเดล machine learning ทุกประเภท
ชุดข้อมูลมะเร็งเต้านมเป็นชุดข้อมูลตัวอย่างจาก sklearn ที่ประกอบด้วย feature ต่าง ๆ ของผู้ป่วย และค่าเป้าหมายที่ระบุว่าผู้ป่วยเป็นมะเร็งเต้านมหรือไม่ ข้อมูลอยู่ในรูปแบบ dictionary โดย feature หลักเก็บไว้ในอาร์เรย์ชื่อ data และค่าเป้าหมายเก็บไว้ในอาร์เรย์ชื่อ target ดังนั้น cancer_data.data จะเป็น feature และ cancer_data.target จะเป็นค่าเป้าหมาย ข้อมูลตัวอย่างถูกโหลดไว้เป็น cancer_data พร้อมกับ pandas ในชื่อ pd และสามารถใช้ LogisticRegression ได้ผ่าน sklearn.linear_model
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การพยากรณ์ CTR ด้วย Machine Learning ใน Python
คำแนะนำการฝึกหัด
- กำหนด
Xและyโดยใช้dataและtargetตามลำดับ - กำหนดให้
X_trainและy_trainเป็น 300 ตัวอย่างแรกของXและyตามลำดับ โดยใช้X[:300]สำหรับX_train - กำหนดให้
X_testและy_testเป็นข้อมูลที่เหลือของXและyตามลำดับ (ยกเว้น 300 ตัวอย่างแรก) โดยใช้X[300:]สำหรับX_test
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Define X and y
X = cancer_data.____
y = cancer_data.____
# Define training and testing data
X_train = X[____]
X_test = X[____]
y_train = y[____]
y_test = y[____]