Skapa tränings- och testdatamängder
Att dela upp en datamängd i en tränings- och en testdel är ett viktigt steg när man bygger och utvärderar en klassificeringsmodell. Träningsdelen används för att bygga modellen och testdelen för att utvärdera dess prediktiva träffsäkerhet.
I den här övningen delar du upp datamängden som du skapade i föregående kapitel i en tränings- och en testdel. Datamängden har lästs in i dataramen df och ett slumpmässigt frö har redan satts för att säkerställa reproducerbarhet. Kom ihåg att vi i föregående video bestämde den övre gränsen för träningsdatamängdens storlek med hjälp av några praktiska funktioner – nu är det din tur att implementera dem!
Den här övningen är en del av kursen
Support Vector Machines i R
Övningsinstruktioner
- Bestäm den övre gränsen för antalet rader i träningsdelen och lagra den i
sample_size. - Skapa vektorn
trainsom lagrar de slumpmässigt tilldelade träningsraderna enligt fördelningen 80/20. - Tilldela raderna i vektorn
traintill dataramentrainsetoch resterande rader till dataramentestset.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))
# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)
# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]