Tạo bộ dữ liệu huấn luyện và kiểm tra
Chia một tập dữ liệu thành bộ huấn luyện và bộ kiểm tra là bước quan trọng khi xây dựng và đánh giá mô hình phân loại. Bộ huấn luyện dùng để xây dựng mô hình, còn bộ kiểm tra dùng để đánh giá độ chính xác dự đoán.
Trong bài tập này, bạn sẽ chia tập dữ liệu mà bạn đã tạo ở chương trước thành bộ huấn luyện và bộ kiểm tra. Tập dữ liệu đã được nạp vào data frame df và seed đã được thiết lập để đảm bảo khả năng tái lập. Hãy nhớ rằng trong video trước, chúng ta đã đặt cận trên cho độ dài của bộ huấn luyện bằng một vài hàm tiện lợi — giờ đến lượt bạn tự triển khai chúng!
Bài tập này là một phần của khóa học
Support Vector Machines bằng R
Hướng dẫn bài tập
- Xác định cận trên cho số lượng hàng thuộc bộ huấn luyện và lưu vào
sample_size. - Tạo vector
trainlưu trữ chỉ số các hàng được gán ngẫu nhiên vào bộ huấn luyện theo tỷ lệ 80/20. - Gán các hàng có trong vector
trainvào data frametrainsetvà phần còn lại vào data frametestset.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))
# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)
# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]