Tạo tập kiểm tra ngẫu nhiên
Trước khi xây dựng một mô hình cho vay tinh vi hơn, điều quan trọng là giữ lại một phần dữ liệu khoản vay để mô phỏng mức độ dự đoán kết quả của các hồ sơ vay trong tương lai.
Như minh họa trong hình dưới đây, bạn có thể dùng 75% quan sát để huấn luyện và 25% để kiểm tra mô hình.

Hàm sample() có thể dùng để tạo một mẫu ngẫu nhiên các dòng đưa vào tập huấn luyện. Chỉ cần cung cấp tổng số quan sát và số lượng cần cho huấn luyện.
Hãy dùng vector ID dòng thu được để chia loans thành các tập dữ liệu huấn luyện và kiểm tra. Dataset loans đã sẵn sàng để bạn sử dụng.
Bài tập này là một phần của khóa học
Học có giám sát trong R: Phân loại
Hướng dẫn bài tập
- Dùng hàm
nrow()để xác định có bao nhiêu quan sát trong datasetloans, và số lượng cần cho mẫu 75%. - Dùng hàm
sample()để tạo một vector số nguyên gồm các ID dòng cho mẫu 75%. Đối số thứ nhất củasample()là số dòng trong dataset, còn đối số thứ hai là số dòng bạn cần cho tập huấn luyện. - Chia nhỏ dữ liệu
loanstheo các ID dòng để tạo tập huấn luyện. Lưu lại dưới tênloans_train. - Chia
loanslần nữa, nhưng lần này chọn tất cả các dòng KHÔNG thuộcsample_rows. Lưu lại dưới tênloans_test
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Determine the number of rows for training
# Create a random sample of row IDs
sample_rows <- sample(___, ___)
# Create the training dataset
loans_train <- loans[___]
# Create the test dataset
loans_test <- loans[___]