Test vs. Train
Sau khi bạn đã làm sạch dữ liệu và chuẩn bị sẵn sàng cho việc xây dựng mô hình, một bước rất quan trọng là tách dữ liệu thành test set và train set. Sau đó, đừng đụng vào dữ liệu kiểm tra cho đến khi bạn nghĩ rằng mình đã có một mô hình tốt! Trong quá trình xây dựng mô hình và đưa ra giả thuyết, bạn có thể kiểm tra chúng trên dữ liệu huấn luyện để ước lượng hiệu năng.
Khi đã có mô hình ưa thích, bạn có thể xem nó dự đoán dữ liệu mới trong test set tốt đến đâu. Phần dữ liệu chưa từng thấy này sẽ cho bạn cái nhìn thực tế hơn nhiều về hiệu năng của mô hình trong thế giới thực khi bạn cố gắng dự đoán hoặc phân loại dữ liệu mới.
Trong Spark, điều quan trọng là phải tách dữ liệu sau tất cả các bước biến đổi. Lý do là các thao tác như StringIndexer không phải lúc nào cũng tạo ra cùng một chỉ số ngay cả khi được cung cấp cùng một danh sách chuỗi.
Tại sao việc dùng test set lại quan trọng trong đánh giá mô hình?
Bài tập này là một phần của khóa học
Nền tảng về PySpark
Bài tập tương tác thực hành
Biến lý thuyết thành hành động với một trong các bài tập tương tác của chúng tôi
Bắt đầu bài tập