Vyzkoušej rozdělení 60/40
Jak jsi viděl/a ve videu, v této kapitole budeš pracovat s datasetem Sonar a rozdělíš ho na 60% trénovací a 40% testovací sadu. Pojďme si rozdělení na trénovací a testovací data procvičit ještě jednou, ať ho máš pevně v ruce. Připomeň si, že funkce sample() ti vrátí náhodnou permutaci indexů řádků datasetu – to se hodí při vytváření trénovací a testovací sady, například:
n_obs <- nrow(my_data)
permuted_rows <- sample(n_obs)
Tyto indexy pak použij k náhodnému přeuspořádání datasetu, například:
my_data <- my_data[permuted_rows, ]
Jakmile máš dataset náhodně seřazený, odděl prvních 60 % jako trénovací sadu a zbývajících 40 % jako testovací sadu.
Toto cvičení je součástí kurzu
Machine Learning s balíčkem caret v R
Pokyny k cvičení
- Zjisti počet pozorování (řádků) v datasetu
Sonara výsledek ulož do proměnnén_obs. - Náhodně přeuspořádej indexy řádků datasetu
Sonara výsledek ulož dopermuted_rows. - Pomocí
permuted_rowsnáhodně přeuspořádej řádky datasetuSonara výsledek ulož jakoSonar_shuffled. - Urči správný řádek pro rozdělení v poměru 60/40 a jeho číslo ulož jako
split. - Ulož prvních 60 % datasetu
Sonar_shuffledjako trénovací sadu. - Ulož posledních 40 % datasetu
Sonar_shuffledjako testovací sadu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Get the number of observations
# Shuffle row indices: permuted_rows
# Randomly order data: Sonar
# Identify row to split on: split
split <- round(n_obs * ___)
# Create train
# Create test