Předpovědi na testovací sadě
Teď, když máš náhodně rozdělenou trénovací a testovací sadu, můžeš použít funkci lm() – stejně jako v prvním cvičení – a natrénovat model na trénovací sadě místo na celém datasetu. Připomeň si, že pomocí formulového rozhraní funkce pro lineární regresi můžeš natrénovat model se zadanou cílovou proměnnou a všemi ostatními proměnnými v datasetu jako prediktory:
mod <- lm(y ~ ., training_data)
K vytvoření předpovědí z tohoto modelu na nových datech slouží funkce predict(). Nový dataset musí obsahovat všechny sloupce z trénovacích dat, ale mohou být v jiném pořadí a s různými hodnotami. Místo opakovaného předpovídání na trénovací sadě teď provedeš předpovědi na testovací sadě, kterou jsi při trénování modelu nepoužil/a. To ti v dalším cvičení umožní zjistit chybu modelu na nových datech:
p <- predict(model, new_data)
Toto cvičení je součástí kurzu
Machine Learning s balíčkem caret v R
Pokyny k cvičení
- Natrénuj model
lm()s názvemmodel, který bude předpovídatprices využitím všech ostatních proměnných jako kovariát. Nezapomeň použít trénovací sadutrain. - Proveď předpovědi na testovací sadě
testpomocí funkcepredict(). Výsledné hodnoty ulož do vektoru s názvemp.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Fit lm model on train: model
# Predict on test: p