สำรวจอัตราการเลิกใช้บริการและแบ่งข้อมูล
ต่อยอดจากภาพรวมที่เห็นในบทที่ 1 บทเรียนนี้จะเจาะลึกลงไปในขั้นตอนการเตรียมข้อมูลสำหรับการใช้ machine learning เพื่อทำนายการเลิกใช้บริการ (churn) โดยจะสำรวจการกระจายตัวของ churn และแบ่งข้อมูลออกเป็นชุดฝึกและชุดทดสอบก่อนเข้าสู่ขั้นตอนการสร้างโมเดล ในขั้นตอนนี้จะทำความเข้าใจการกระจายตัวของอัตรา churn และเตรียมข้อมูลให้พร้อมสำหรับการสร้างโมเดลบนชุดฝึก รวมถึงวัดประสิทธิภาพบนชุดทดสอบที่ยังไม่เคยใช้
ชุดข้อมูลโทรคมนาคมถูกโหลดเป็น DataFrame ของ pandas ชื่อว่า telcom โดยคอลัมน์ตัวแปรเป้าหมายมีชื่อว่า Churn
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Machine Learning สำหรับการตลาดด้วย Python
คำแนะนำการฝึกหัด
- แสดงค่าที่ไม่ซ้ำกันในคอลัมน์
Churn - คำนวณสัดส่วนขนาดของแต่ละกลุ่ม churn
- Import ฟังก์ชันสำหรับแบ่งข้อมูลเป็นชุดฝึกและชุดทดสอบ
- แบ่งข้อมูลออกเป็นชุดฝึก 75% และชุดทดสอบ 25%
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Print the unique Churn values
print(___(telcom['Churn']))
# Calculate the ratio size of each churn group
telcom.___(['Churn']).size() / telcom.shape[0] * 100
# Import the function for splitting data to train and test
from sklearn.model_selection import ___
# Split the data into train and test
train, test = ___(telcom, test_size = .25)