Kom igångKom igång gratis

Skapa tränings- och testdatamängder

Att dela upp en datamängd i en tränings- och en testdel är ett viktigt steg när man bygger och utvärderar en klassificeringsmodell. Träningsdelen används för att bygga modellen och testdelen för att utvärdera dess prediktiva träffsäkerhet.

I den här övningen delar du upp datamängden som du skapade i föregående kapitel i en tränings- och en testdel. Datamängden har lästs in i dataramen df och ett slumpmässigt frö har redan satts för att säkerställa reproducerbarhet. Kom ihåg att vi i föregående video bestämde den övre gränsen för träningsdatamängdens storlek med hjälp av några praktiska funktioner – nu är det din tur att implementera dem!

Den här övningen är en del av kursen

Support Vector Machines i R

Visa kurs

Övningsinstruktioner

  • Bestäm den övre gränsen för antalet rader i träningsdelen och lagra den i sample_size.
  • Skapa vektorn train som lagrar de slumpmässigt tilldelade träningsraderna enligt fördelningen 80/20.
  • Tilldela raderna i vektorn train till dataramen trainset och resterande rader till dataramen testset.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))

# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)

# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]
Redigera och kör kod