การฝึกโมเดล Logistic Regression
หลังจากสร้างป้ายกำกับและ feature จากข้อมูลแล้ว ก็ถึงเวลาสร้างโมเดลเพื่อเรียนรู้จากข้อมูลนั้น (การฝึก) แต่ก่อนฝึกโมเดล ในขั้นตอนสุดท้ายของแบบฝึกหัดนี้ คุณจะแบ่งข้อมูลออกเป็นชุดฝึกและชุดทดสอบ รันโมเดล Logistic Regression บนชุดข้อมูลฝึก แล้วตรวจสอบความแม่นยำของโมเดล
ระบบมี SparkContext sc และตัวแปร samples พร้อมใช้งานในพื้นที่ทำงานของคุณ
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
Big Data Fundamentals with PySpark
คำแนะนำการฝึกหัด
- แบ่งข้อมูลที่รวมไว้เป็นชุดฝึกและชุดทดสอบในอัตราส่วน 80:20
- ฝึกโมเดล Logistic Regression ด้วยชุดข้อมูลฝึก
- สร้างป้ายกำกับการทำนายจากโมเดลที่ฝึกแล้วโดยใช้ชุดข้อมูลทดสอบ
- รวมป้ายกำกับในชุดข้อมูลทดสอบกับป้ายกำกับในชุดข้อมูลทำนายโดยใช้ฟังก์ชัน
zip - คำนวณความแม่นยำของโมเดลจากป้ายกำกับจริงและป้ายกำกับที่ทำนาย แล้วแสดงผลออกมา
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Split the data into training and testing
train_samples,test_samples = samples.____([0.8, 0.2])
# Train the model
model = LogisticRegressionWithLBFGS.train(____)
# Create a prediction label from the test data
predictions = model.____(test_samples.map(lambda x: x.features))
# Combine original labels with the predicted labels
labels_and_preds = test_samples.map(lambda x: x.label).zip(____)
# Check the accuracy of the model on the test data
accuracy = labels_and_preds.filter(lambda x: x[0] == x[____]).count() / float(test_samples.count())
print("Model accuracy : {:.2f}".format(____))