Kom igångKom igång gratis

Uppdelning i tränings- och testdata

I ett välstrukturerat maskininlärningsarbetsflöde är det viktigt att hålla undan en del av datan (testdata) från alla beslut under modellutvecklingen. Det gör att du kan utvärdera modellens prestanda oberoende när den väl är färdig. Den återstående datan, träningsdatan, används för att bygga och välja den bästa modellen.

I den här övningen använder du paketet rsample för att dela upp din gapminder-data i en initial tränings- och testuppsättning.

Obs! Eftersom uppdelningen sker slumpmässigt är det god praxis att ange ett seed innan du delar datan.

Den här övningen är en del av kursen

Maskininlärning med Tidyverse

Visa kurs

Övningsinstruktioner

  • Dela upp datan i 75 % träning och 25 % test med funktionen initial_split() och tilldela resultatet till gap_split.
  • Extrahera träningsdataramen från gap_split med funktionen training().
  • Extrahera testdataramen från gap_split med funktionen testing().
  • Kontrollera att dimensionerna för dina nya dataramar stämmer med förväntningarna genom att använda dim()training_data och testing_data.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

set.seed(42)

# Prepare the initial split object
gap_split <- initial_split(___, prop = ___)

# Extract the training data frame
training_data <- ___

# Extract the testing data frame
testing_data <- ___

# Calculate the dimensions of both training_data and testing_data
dim(___)
dim(___)
Redigera och kör kod