बाइक रेंटल डेटा पर vtreat लागू करें
इस अभ्यास में, आप जुलाई/अगस्त के बाइक डेटा के लिए one-hot-encoded डेटा फ्रेम बनाएँगे, जिन्हें आगे xgboost के साथ उपयोग किया जाएगा.
डेटा फ्रेम bikesJuly और bikesAugust पहले से लोड किए गए हैं.
आपकी सुविधा के लिए, हमने मॉडल के लिए वैरिएबल कॉलम्स की सूची के साथ वैरिएबल vars परिभाषित कर दिया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Supervised Learning: Regression
अभ्यास निर्देश
- पैकेज
vtreatलोड करें. designTreatmentsZ()का उपयोग करकेbikesJuly(ट्रेनिंग डेटा) सेvarsमें दी गई वैरिएबल्स के लिए एक ट्रीटमेंट प्लानtreatplanबनाएँ.- फंक्शन को बहुत सारे संदेश प्रिंट करने से रोकने के लिए फ़्लैग
verbose=FALSEसेट करें.
- फंक्शन को बहुत सारे संदेश प्रिंट करने से रोकने के लिए फ़्लैग
- खाली स्थान भरकर एक वेक्टर
newvarsबनाएँ जिसमें केवलcleanऔरlevट्रांसफॉर्म्ड वैरिएबल्स के नाम हों. इसे प्रिंट करें. prepare()का उपयोग करके एक one-hot-encoded ट्रेनिंग डेटा फ्रेमbikesJuly.treatबनाएँ.- आप जिन वैरिएबल्स का उपयोग करेंगे उन्हें
newvarsतक सीमित करने के लिएvarRestrictionsआर्ग्युमेंट का उपयोग करें.
- आप जिन वैरिएबल्स का उपयोग करेंगे उन्हें
- उसी तरह
prepare()का उपयोग करकेbikesAugustसे एक one-hot-encoded टेस्ट फ्रेमbikesAugust.treatबनाएँ. - स्ट्रक्चर देखने के लिए दोनों तैयार किए गए टेस्ट फ्रेम्स पर
str()कॉल करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# The outcome column
(outcome <- "cnt")
# The input columns
(vars <- c("hr", "holiday", "workingday", "weathersit", "temp", "atemp", "hum", "windspeed"))
# Load the package vtreat
___
# Create the treatment plan from bikesJuly (the training data)
treatplan <- ___(___, ___, verbose = FALSE)
# Get the "clean" and "lev" variables from the scoreFrame
(newvars <- treatplan %>%
use_series(scoreFrame) %>%
filter(code %in% ___) %>% # get the rows you care about
use_series(___)) # get the varName column
# Prepare the training data
bikesJuly.treat <- ___(___, ___, varRestriction = ___)
# Prepare the test data
bikesAugust.treat <- ___(___, ___, varRestriction = ___)
# Call str() on the treated data
___
___