Bắt đầu ngayBắt đầu miễn phí

Dùng vtreat cho dữ liệu thuê xe đạp

Trong bài tập này, bạn sẽ tạo các data frame dạng one-hot-encoding từ dữ liệu xe đạp tháng 7/tháng 8, để dùng với xgboost ở phần sau.

Các data frame bikesJulybikesAugust đã được nạp sẵn.

Để thuận tiện, chúng tôi đã định nghĩa biến vars chứa danh sách các cột biến cho mô hình.

Bài tập này là một phần của khóa học

Học có giám sát với R: Hồi quy

Xem khóa học

Hướng dẫn bài tập

  • Nạp gói vtreat.
  • Dùng designTreatmentsZ() để tạo treatment plan treatplan cho các biến trong vars từ bikesJuly (dữ liệu huấn luyện).
    • Đặt cờ verbose=FALSE để tránh hàm in quá nhiều thông báo.
  • Điền vào chỗ trống để tạo một vector newvars chỉ chứa tên các biến đã được biến đổi kiểu cleanlev. In kết quả ra.
  • Dùng prepare() để tạo data frame huấn luyện one-hot-encoded bikesJuly.treat.
    • Dùng đối số varRestrictions để giới hạn các biến sử dụng vào newvars.
  • Dùng prepare() để tạo test frame one-hot-encoded bikesAugust.treat từ bikesAugust theo cách tương tự.
  • Gọi str() trên cả hai test frame đã chuẩn bị để xem cấu trúc.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# The outcome column
(outcome <- "cnt")

# The input columns
(vars <- c("hr", "holiday", "workingday", "weathersit", "temp", "atemp", "hum", "windspeed"))

# Load the package vtreat
___

# Create the treatment plan from bikesJuly (the training data)
treatplan <- ___(___, ___, verbose = FALSE)

# Get the "clean" and "lev" variables from the scoreFrame
(newvars <- treatplan %>%
  use_series(scoreFrame) %>%        
  filter(code %in% ___) %>%  # get the rows you care about
  use_series(___))           # get the varName column

# Prepare the training data
bikesJuly.treat <- ___(___, ___,  varRestriction = ___)

# Prepare the test data
bikesAugust.treat <- ___(___, ___,  varRestriction = ___)

# Call str() on the treated data
___
___
Chỉnh sửa và Chạy Mã