Bắt đầu ngayBắt đầu miễn phí

Cross validation

Trong vài bài tiếp theo, bạn sẽ tinh chỉnh mô hình logistic regression bằng thủ tục gọi là k-fold cross validation. Đây là một cách ước lượng hiệu năng của mô hình trên dữ liệu chưa từng thấy (như DataFrame test của bạn).

Cách làm là chia dữ liệu huấn luyện thành một vài phần (partition) khác nhau. Số lượng cụ thể là tùy bạn, nhưng trong khóa học này bạn sẽ dùng giá trị mặc định của PySpark là ba. Sau khi chia xong, một phần sẽ được giữ lại, và mô hình được fit trên các phần còn lại. Tiếp theo, sai số được đo trên phần đã giữ lại. Quá trình này lặp lại cho từng phần, để mỗi khối dữ liệu đều được giữ lại và dùng làm test set đúng một lần. Sau đó, sai số trên từng phần được lấy trung bình. Đây được gọi là cross validation error của mô hình và là một ước lượng tốt cho sai số thực tế trên dữ liệu giữ lại.

Bạn sẽ dùng cross validation để chọn các hyperparameter bằng cách tạo một lưới các cặp giá trị khả dĩ cho hai hyperparameter, elasticNetParamregParam, rồi dùng cross validation error để so sánh tất cả các mô hình khác nhau nhằm chọn ra mô hình tốt nhất!

Cross validation cho phép bạn ước lượng điều gì?

Bài tập này là một phần của khóa học

Nền tảng về PySpark

Xem khóa học

Bài tập tương tác thực hành

Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi

Bắt đầu bài tập