vtreat pro data o půjčování kol
V tomto cvičení vytvoříš one-hot-enkódované datové rámce z dat o půjčování kol za červenec a srpen, které pak použiješ s xgboost.
Dataové rámce bikesJuly a bikesAugust jsou již načteny.
Pro usnadnění práce je proměnná vars předem definována se seznamem sloupců proměnných pro model.
Toto cvičení je součástí kurzu
Supervised Learning in R: Regression
Pokyny k cvičení
- Načti balíček
vtreat. - Pomocí
designTreatmentsZ()vytvoř plán úpravtreatplanpro proměnné vvarsz datového rámcebikesJuly(trénovací data).- Nastav příznak
verbose=FALSE, aby funkce nevypisovala příliš mnoho zpráv.
- Nastav příznak
- Doplň chybějící části a vytvoř vektor
newvarsobsahující pouze názvy transformovaných proměnných typucleanalev. Vypiš ho. - Pomocí
prepare()vytvoř one-hot-enkódovaný trénovací datový rámecbikesJuly.treat.- Pomocí argumentu
varRestrictionsomez použité proměnné na ty vnewvars.
- Pomocí argumentu
- Stejným způsobem vytvoř pomocí
prepare()one-hot-enkódovaný testovací rámecbikesAugust.treatz datového rámcebikesAugust. - Zavolej
str()na oba připravené datové rámce a prohlédni si jejich strukturu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# The outcome column
(outcome <- "cnt")
# The input columns
(vars <- c("hr", "holiday", "workingday", "weathersit", "temp", "atemp", "hum", "windspeed"))
# Load the package vtreat
___
# Create the treatment plan from bikesJuly (the training data)
treatplan <- ___(___, ___, verbose = FALSE)
# Get the "clean" and "lev" variables from the scoreFrame
(newvars <- treatplan %>%
use_series(scoreFrame) %>%
filter(code %in% ___) %>% # get the rows you care about
use_series(___)) # get the varName column
# Prepare the training data
bikesJuly.treat <- ___(___, ___, varRestriction = ___)
# Prepare the test data
bikesAugust.treat <- ___(___, ___, varRestriction = ___)
# Call str() on the treated data
___
___