Dự đoán trên dữ liệu kiểm thử
Một mô hình logistic đã được fit là df_fitted đã có sẵn. Một dataframe df_testset chứa dữ liệu kiểm thử cho mô hình này cũng đã có. Biến fields có sẵn, chứa danh sách ['prediction', 'label', 'endword', 'doc', 'probability']; biến này được dùng để chỉ định các trường dự đoán sẽ in ra.
Bài tập này là một phần của khóa học
Nhập môn Spark SQL bằng Python
Hướng dẫn bài tập
- Áp dụng mô hình lên dữ liệu trong
df_testset. - In "incorrect" nếu dự đoán không khớp với nhãn.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Apply the model to the test data
predictions = df_fitted.____(____).select(fields)
# Print incorrect if prediction does not match label
for x in predictions.take(8):
print()
if x.label != int(x.____):
print("INCORRECT ==> ")
for y in fields:
print(y,":", x[y])