Vyzkoušej rozdělení 80/20
Teď, když jsou data náhodně seřazená, můžeš prvních 80 % rozdělit do trénovací sady a posledních 20 % do testovací. Stačí zvolit bod rozdělení přibližně v 80 % délky datasetu:
split <- round(nrow(mydata) * 0.80)
Tento bod pak použij k oddělení prvních 80 % datasetu jako trénovací sady:
mydata[1:split, ]
A stejný bod poslouží i k vymezení testovací sady:
mydata[(split + 1):nrow(mydata), ]
Toto cvičení je součástí kurzu
Machine Learning s balíčkem caret v R
Pokyny k cvičení
- Urči index řádku pro rozdělení tak, aby bod rozdělení ležel přibližně v 80 % datasetu
diamonds. Tento index pojmenujsplit. - Vytvoř trénovací sadu s názvem
trainpomocí tohoto indexu. - Vytvoř testovací sadu s názvem
testpomocí tohoto indexu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Determine row to split on: split
# Create train
# Create test