Bắt đầu ngayBắt đầu miễn phí

Tạo bộ dữ liệu huấn luyện và kiểm tra

Chia một tập dữ liệu thành bộ huấn luyện và bộ kiểm tra là bước quan trọng khi xây dựng và đánh giá mô hình phân loại. Bộ huấn luyện dùng để xây dựng mô hình, còn bộ kiểm tra dùng để đánh giá độ chính xác dự đoán.

Trong bài tập này, bạn sẽ chia tập dữ liệu mà bạn đã tạo ở chương trước thành bộ huấn luyện và bộ kiểm tra. Tập dữ liệu đã được nạp vào data frame df và seed đã được thiết lập để đảm bảo khả năng tái lập. Hãy nhớ rằng trong video trước, chúng ta đã đặt cận trên cho độ dài của bộ huấn luyện bằng một vài hàm tiện lợi — giờ đến lượt bạn tự triển khai chúng!

Bài tập này là một phần của khóa học

Support Vector Machines bằng R

Xem khóa học

Hướng dẫn bài tập

  • Xác định cận trên cho số lượng hàng thuộc bộ huấn luyện và lưu vào sample_size.
  • Tạo vector train lưu trữ chỉ số các hàng được gán ngẫu nhiên vào bộ huấn luyện theo tỷ lệ 80/20.
  • Gán các hàng có trong vector train vào data frame trainset và phần còn lại vào data frame testset.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))

# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)

# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]
Chỉnh sửa và Chạy Mã