Chia train/test
Để đánh giá khách quan một mô hình Machine Learning, bạn cần kiểm tra nó trên một tập dữ liệu độc lập. Bạn không thể dùng chính dữ liệu đã dùng để huấn luyện mô hình: dĩ nhiên mô hình sẽ hoạt động (tương đối) tốt trên những dữ liệu đó!
Bạn sẽ chia dữ liệu thành hai phần:
- dữ liệu huấn luyện (dùng để huấn luyện mô hình) và
- dữ liệu kiểm tra (dùng để kiểm tra mô hình).
Lưu ý: Từ đây bạn sẽ làm việc với một tập con nhỏ hơn của dữ liệu chuyến bay, để các bài tập chạy nhanh hơn.
Bài tập này là một phần của khóa học
Machine Learning với PySpark
Hướng dẫn bài tập
- Chia ngẫu nhiên dữ liệu
flightsthành hai tập với tỷ lệ 80:20. Để có thể lặp lại, đặt seed ngẫu nhiên là 43 cho lần chia này. - Kiểm tra rằng dữ liệu huấn luyện có xấp xỉ 80% số bản ghi từ dữ liệu gốc.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Split into training and testing sets in a 80:20 ratio
flights_train, flights_test = flights.____(____, ____)
# Check that training set has around 80% of records
training_ratio = flights_train.____() / ____.____()
print(training_ratio)