Kom igångKom igång gratis

Skapa slumpmässiga testdatamängder

Innan du bygger en mer avancerad kreditmodell är det viktigt att avsätta en del av lånedata för att simulera hur väl modellen kommer att förutsäga utfallen för framtida lånesökande.

Som bilden nedan visar kan du använda 75 % av observationerna för träning och 25 % för att testa modellen.

Funktionen sample() kan användas för att generera ett slumpmässigt urval av rader att inkludera i träningsdatan. Ange bara det totala antalet observationer och hur många som behövs för träning.

Använd den resulterande vektorn med rad-ID:n för att dela upp loans i en tränings- och en testdatamängd. Datamängden loans finns tillgänglig för dig att använda.

Den här övningen är en del av kursen

Övervakat lärande i R: Klassificering

Visa kurs

Övningsinstruktioner

  • Använd funktionen nrow() för att ta reda på hur många observationer datamängden loans innehåller, samt hur många som behövs för ett urval på 75 %.
  • Använd funktionen sample() för att skapa en heltalsvektor med rad-ID:n för urvalet på 75 %. Det första argumentet till sample() ska vara antalet rader i datamängden och det andra är antalet rader du behöver i din träningsuppsättning.
  • Filtrera loans-datan med hjälp av rad-ID:na för att skapa träningsdatamängden. Spara den som loans_train.
  • Filtrera loans igen, men välj den här gången alla rader som inte finns i sample_rows. Spara detta som loans_test.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Determine the number of rows for training


# Create a random sample of row IDs
sample_rows <- sample(___, ___)

# Create the training dataset
loans_train <- loans[___]

# Create the test dataset
loans_test <- loans[___]
Redigera och kör kod