Kom igångKom igång gratis

Dela upp datamängden

För att skapa dina tränings- och testuppsättningar bör du först ange ett frö med hjälp av set.seed(). Frön låter dig ange en startpunkt för slumpmässigt genererade tal, så att koden ger samma resultat varje gång den körs. Fördelen med detta är att du – eller vem som helst – kan återskapa exakt samma tränings- och testuppsättningar genom att använda samma frö.

Med hjälp av sample() kan du slumpmässigt fördela observationer på tränings- och testuppsättningen.

I den här övningen använder du de två första argumenten i funktionen sample():

  • Det första argumentet är den vektor vi samplar värden från. Vi väljer slumpmässigt radnummer som index; du kan använda 1:nrow(loan_data) för att skapa vektorn med radnummer.
  • Det andra argumentet är antalet element som ska väljas. Vi anger 2 / 3 * nrow(loan_data), eftersom vi skapar träningsuppsättningen först.

Den här övningen är en del av kursen

Kreditriskmodellering i R

Visa kurs

Övningsinstruktioner

  • Ange ett frö med värdet 567 med hjälp av funktionen set.seed().
  • Lagra radindexen för träningsuppsättningen i objektet index_train. Använd funktionen sample() med ett första och ett andra argument enligt beskrivningen ovan.
  • Skapa träningsuppsättningen genom att välja de radnummer som lagrats i index_train från datamängden loan_data. Spara resultatet i training_set.
  • Testuppsättningen innehåller de rader som inte finns i index_train. Kopiera koden du använde för att skapa träningsuppsättningen, men lägg till ett minustecken (-) direkt före index_train inuti hakparenteserna. Spara resultatet i test_set.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Set seed of 567


# Store row numbers for training set: index_train


# Create training set: training_set
training_set <- loan_data[___, ]

# Create test set: test_set
Redigera och kör kod