Huấn luyện mô hình
Cuối cùng thì bạn cũng đã sẵn sàng huấn luyện các mô hình và chọn mô hình tốt nhất!
Đáng tiếc là cross validation tiêu tốn rất nhiều tài nguyên tính toán. Huấn luyện tất cả mô hình sẽ mất quá nhiều thời gian trên DataCamp.
Nếu chạy cục bộ, bạn sẽ dùng đoạn mã:
# Huấn luyện các mô hình cross validation
models = cv.fit(training)
# Trích xuất mô hình tốt nhất
best_lr = models.bestModel
Hãy nhớ, dữ liệu huấn luyện có tên là training và bạn đang dùng lr để khớp một mô hình logistic regression. Cross validation đã chọn giá trị tham số regParam=0 và elasticNetParam=0 là tốt nhất. Đây là các giá trị mặc định, nên bạn không cần làm gì thêm với lr trước khi huấn luyện mô hình.
Bài tập này là một phần của khóa học
Nền tảng về PySpark
Hướng dẫn bài tập
- Tạo
best_lrbằng cách gọilr.fit()trên dữ liệutraining. - In
best_lrđể kiểm tra rằng đây là một đối tượng thuộc lớpLogisticRegressionModel.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Call lr.fit()
best_lr = ____
# Print best_lr
print(____)