Aplica vtreat a los datos de alquiler de bicis
En este ejercicio, crearás data frames con one-hot encoding de los datos de julio/agosto de bicicletas, para usarlos más adelante con xgboost.
Los data frames bikesJuly y bikesAugust ya están precargados.
Para tu comodidad, hemos definido la variable vars con la lista de columnas de variables para el modelo.
Este ejercicio forma parte del curso
Aprendizaje supervisado en R: Regresión
Instrucciones del ejercicio
- Carga el paquete
vtreat. - Usa
designTreatmentsZ()para crear un plan de tratamientotreatplanpara las variables devarsa partir debikesJuly(los datos de entrenamiento).- Establece la marca
verbose=FALSEpara evitar que la función imprima demasiados mensajes.
- Establece la marca
- Rellena los huecos para crear un vector
newvarsque contenga solo los nombres de las variables transformadascleanylev. Imprímelo. - Usa
prepare()para crear un data frame de entrenamiento con one-hot encodingbikesJuly.treat.- Usa el argumento
varRestrictionspara limitar las variables que utilizarás anewvars.
- Usa el argumento
- Usa
prepare()para crear de la misma forma un data frame de prueba con one-hot encodingbikesAugust.treata partir debikesAugust. - Llama a
str()sobre ambos data frames preparados para ver su estructura.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# The outcome column
(outcome <- "cnt")
# The input columns
(vars <- c("hr", "holiday", "workingday", "weathersit", "temp", "atemp", "hum", "windspeed"))
# Load the package vtreat
___
# Create the treatment plan from bikesJuly (the training data)
treatplan <- ___(___, ___, verbose = FALSE)
# Get the "clean" and "lev" variables from the scoreFrame
(newvars <- treatplan %>%
use_series(scoreFrame) %>%
filter(code %in% ___) %>% # get the rows you care about
use_series(___)) # get the varName column
# Prepare the training data
bikesJuly.treat <- ___(___, ___, varRestriction = ___)
# Prepare the test data
bikesAugust.treat <- ___(___, ___, varRestriction = ___)
# Call str() on the treated data
___
___