1. Học hỏi
  2. /
  3. Khoa Học
  4. /
  5. Học có giám sát với R: Hồi quy

Connected

Bài tập

Tạo ngẫu nhiên tập train/test

Trong một vài bài tập tiếp theo, bạn sẽ dùng dữ liệu mpg từ gói ggplot2. Bộ dữ liệu mô tả các đặc điểm của nhiều hãng và mẫu xe qua các năm. Mục tiêu là dự đoán mức tiêu thụ nhiên liệu trong thành phố dựa trên mức tiêu thụ trên xa lộ.

Trong bài này, bạn sẽ chia mpg thành tập huấn luyện mpg_train (75% dữ liệu) và tập kiểm tra mpg_test (25% dữ liệu). Một cách để làm điều này là tạo một cột số ngẫu nhiên đồng đều trong khoảng 0 đến 1, dùng hàm runif() (docs).

Nếu bạn có một tập dữ liệu dframe kích thước \(N\), và bạn muốn một tập con ngẫu nhiên có kích thước xấp xỉ \(100 * X\)% của \(N\) (với \(X\) nằm giữa 0 và 1), thì:

  1. Tạo một vector số ngẫu nhiên đồng đều: gp = runif(N).
  2. dframe[gp < X,] sẽ có kích thước xấp xỉ mong muốn.
  3. dframe[gp >= X,] sẽ là phần bù còn lại.

Hướng dẫn

100 XP
  • Dùng hàm nrow (docs) để lấy số hàng của data frame mpg. Gán con số này vào biến N và in ra.
  • Tính xem 75% của N xấp xỉ bao nhiêu hàng. Gán vào biến target và in ra.
  • Dùng runif() để tạo một vector gồm N số ngẫu nhiên đồng đều, gọi là gp.
  • Dùng gp để chia mpg thành mpg_train và mpg_test (trong đó mpg_train chứa khoảng 75% dữ liệu).
  • Dùng nrow() để kiểm tra kích thước của mpg_train và mpg_test. Chúng có xấp xỉ kích thước mong muốn không?