Dela upp datamängden
För att skapa dina tränings- och testuppsättningar bör du först ange ett frö med hjälp av set.seed(). Frön låter dig ange en startpunkt för slumpmässigt genererade tal, så att koden ger samma resultat varje gång den körs. Fördelen med detta är att du – eller vem som helst – kan återskapa exakt samma tränings- och testuppsättningar genom att använda samma frö.
Med hjälp av sample() kan du slumpmässigt fördela observationer på tränings- och testuppsättningen.
I den här övningen använder du de två första argumenten i funktionen sample():
- Det första argumentet är den vektor vi samplar värden från. Vi väljer slumpmässigt radnummer som index; du kan använda
1:nrow(loan_data)för att skapa vektorn med radnummer. - Det andra argumentet är antalet element som ska väljas. Vi anger
2 / 3 * nrow(loan_data), eftersom vi skapar träningsuppsättningen först.
Den här övningen är en del av kursen
Kreditriskmodellering i R
Övningsinstruktioner
- Ange ett frö med värdet 567 med hjälp av funktionen
set.seed(). - Lagra radindexen för träningsuppsättningen i objektet
index_train. Använd funktionensample()med ett första och ett andra argument enligt beskrivningen ovan. - Skapa träningsuppsättningen genom att välja de radnummer som lagrats i
index_trainfrån datamängdenloan_data. Spara resultatet itraining_set. - Testuppsättningen innehåller de rader som inte finns i
index_train. Kopiera koden du använde för att skapa träningsuppsättningen, men lägg till ett minustecken (-) direkt föreindex_traininuti hakparenteserna. Spara resultatet itest_set.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Set seed of 567
# Store row numbers for training set: index_train
# Create training set: training_set
training_set <- loan_data[___, ]
# Create test set: test_set