Huấn luyện mô hình Logistic Regression
Sau khi đã tạo nhãn và đặc trưng cho dữ liệu, bạn đã sẵn sàng xây dựng một mô hình có thể học từ đó (huấn luyện). Nhưng trước khi huấn luyện, ở phần cuối của bài tập này, bạn sẽ chia dữ liệu thành tập huấn luyện và tập kiểm tra, chạy mô hình Logistic Regression trên tập huấn luyện, và cuối cùng kiểm tra độ chính xác của mô hình đã được huấn luyện.
Hãy nhớ rằng bạn đã có sẵn SparkContext sc trong workspace, cùng với biến samples.
Bài tập này là một phần của khóa học
Nền tảng Big Data với PySpark
Hướng dẫn bài tập
- Chia dữ liệu đã kết hợp thành hai tập huấn luyện và kiểm tra theo tỷ lệ 80:20.
- Huấn luyện mô hình Logistic Regression với tập huấn luyện.
- Tạo nhãn dự đoán từ mô hình đã huấn luyện trên tập kiểm tra.
- Ghép các nhãn trong tập kiểm tra với nhãn trong tập dự đoán bằng hàm
zip. - Tính độ chính xác của mô hình đã huấn luyện bằng nhãn gốc và nhãn dự đoán, rồi in ra.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Split the data into training and testing
train_samples,test_samples = samples.____([0.8, 0.2])
# Train the model
model = LogisticRegressionWithLBFGS.train(____)
# Create a prediction label from the test data
predictions = model.____(test_samples.map(lambda x: x.features))
# Combine original labels with the predicted labels
labels_and_preds = test_samples.map(lambda x: x.label).zip(____)
# Check the accuracy of the model on the test data
accuracy = labels_and_preds.filter(lambda x: x[0] == x[____]).count() / float(test_samples.count())
print("Model accuracy : {:.2f}".format(____))