vtreat für die Fahrradausleihdaten
In dieser Übung erstellst du One-Hot-enkodierte Data Frames der Juli-/August-Fahrraddaten, die du später mit xgboost verwenden wirst.
Die Data Frames bikesJuly und bikesAugust sind bereits geladen.
Zur Vereinfachung haben wir die Variable vars mit der Liste der Variablenspalten für das Modell definiert.
Diese Übung ist Teil des Kurses
<Kurs>Überwachtes Lernen in R: Regression</Kurs>Übungsanweisungen
- Lade das Paket
vtreat. - Verwende
designTreatmentsZ(), um einen Treatment-Plantreatplanfür die Variablen invarsausbikesJuly(den Trainingsdaten) zu erstellen.- Setze das Flag
verbose=FALSE, damit die Funktion nicht zu viele Meldungen ausgibt.
- Setze das Flag
- Ergänze die Lücken, um einen Vektor
newvarszu erstellen, der nur die Namen der transformierten Variablen vom Typcleanundleventhält. Gib ihn aus. - Verwende
prepare(), um einen One-Hot-enkodierten Trainings-Data-FramebikesJuly.treatzu erstellen.- Nutze das Argument
varRestrictions, um die verwendeten Variablen aufnewvarszu beschränken.
- Nutze das Argument
- Verwende
prepare(), um in gleicher Weise ausbikesAugusteinen One-Hot-enkodierten Test-FramebikesAugust.treatzu erstellen. - Rufe
str()für beide vorbereiteten Test-Frames auf, um die Struktur anzusehen.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# The outcome column
(outcome <- "cnt")
# The input columns
(vars <- c("hr", "holiday", "workingday", "weathersit", "temp", "atemp", "hum", "windspeed"))
# Load the package vtreat
___
# Create the treatment plan from bikesJuly (the training data)
treatplan <- ___(___, ___, verbose = FALSE)
# Get the "clean" and "lev" variables from the scoreFrame
(newvars <- treatplan %>%
use_series(scoreFrame) %>%
filter(code %in% ___) %>% # get the rows you care about
use_series(___)) # get the varName column
# Prepare the training data
bikesJuly.treat <- ___(___, ___, varRestriction = ___)
# Prepare the test data
bikesAugust.treat <- ___(___, ___, varRestriction = ___)
# Call str() on the treated data
___
___