เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การฝึกโมเดล Logistic Regression

หลังจากสร้างป้ายกำกับและ feature จากข้อมูลแล้ว ก็ถึงเวลาสร้างโมเดลเพื่อเรียนรู้จากข้อมูลนั้น (การฝึก) แต่ก่อนฝึกโมเดล ในขั้นตอนสุดท้ายของแบบฝึกหัดนี้ คุณจะแบ่งข้อมูลออกเป็นชุดฝึกและชุดทดสอบ รันโมเดล Logistic Regression บนชุดข้อมูลฝึก แล้วตรวจสอบความแม่นยำของโมเดล

ระบบมี SparkContext sc และตัวแปร samples พร้อมใช้งานในพื้นที่ทำงานของคุณ

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

Big Data Fundamentals with PySpark

ดูคอร์ส

คำแนะนำการฝึกหัด

  • แบ่งข้อมูลที่รวมไว้เป็นชุดฝึกและชุดทดสอบในอัตราส่วน 80:20
  • ฝึกโมเดล Logistic Regression ด้วยชุดข้อมูลฝึก
  • สร้างป้ายกำกับการทำนายจากโมเดลที่ฝึกแล้วโดยใช้ชุดข้อมูลทดสอบ
  • รวมป้ายกำกับในชุดข้อมูลทดสอบกับป้ายกำกับในชุดข้อมูลทำนายโดยใช้ฟังก์ชัน zip
  • คำนวณความแม่นยำของโมเดลจากป้ายกำกับจริงและป้ายกำกับที่ทำนาย แล้วแสดงผลออกมา

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Split the data into training and testing
train_samples,test_samples = samples.____([0.8, 0.2])

# Train the model
model = LogisticRegressionWithLBFGS.train(____)

# Create a prediction label from the test data
predictions = model.____(test_samples.map(lambda x: x.features))

# Combine original labels with the predicted labels
labels_and_preds = test_samples.map(lambda x: x.label).zip(____)

# Check the accuracy of the model on the test data
accuracy = labels_and_preds.filter(lambda x: x[0] == x[____]).count() / float(test_samples.count())
print("Model accuracy : {:.2f}".format(____))
แก้ไขและรันโค้ด