Tách tập kiểm tra – huấn luyện
Trong một quy trình Machine Learning bài bản, điều quan trọng là phải giữ lại một phần dữ liệu (dữ liệu kiểm tra) và không dùng nó trong bất kỳ bước ra quyết định nào. Nhờ vậy, bạn có thể đánh giá độc lập hiệu năng của mô hình sau khi đã hoàn thiện. Phần dữ liệu còn lại, gọi là dữ liệu huấn luyện, được dùng để xây dựng và chọn mô hình tốt nhất.
Trong bài tập này, bạn sẽ dùng gói rsample để chia dữ liệu và thực hiện bước tách ban đầu train-test cho dữ liệu gapminder của bạn.
Lưu ý: Vì việc chia dữ liệu là ngẫu nhiên, bạn nên đặt seed trước khi chia để tái lập kết quả.
Bài tập này là một phần của khóa học
Machine Learning trong tidyverse
Hướng dẫn bài tập
- Chia dữ liệu thành 75% huấn luyện và 25% kiểm tra bằng hàm
initial_split()và gán vàogap_split. - Trích xuất data frame huấn luyện từ
gap_splitbằng hàmtraining(). - Trích xuất data frame kiểm tra từ
gap_splitbằng hàmtesting(). - Kiểm tra kích thước của các data frame mới có đúng như mong đợi không bằng cách dùng hàm
dim()trêntraining_datavàtesting_data.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
set.seed(42)
# Prepare the initial split object
gap_split <- initial_split(___, prop = ___)
# Extract the training data frame
training_data <- ___
# Extract the testing data frame
testing_data <- ___
# Calculate the dimensions of both training_data and testing_data
dim(___)
dim(___)