Uppdelning i tränings- och testdata
I ett välstrukturerat maskininlärningsarbetsflöde är det viktigt att hålla undan en del av datan (testdata) från alla beslut under modellutvecklingen. Det gör att du kan utvärdera modellens prestanda oberoende när den väl är färdig. Den återstående datan, träningsdatan, används för att bygga och välja den bästa modellen.
I den här övningen använder du paketet rsample för att dela upp din gapminder-data i en initial tränings- och testuppsättning.
Obs! Eftersom uppdelningen sker slumpmässigt är det god praxis att ange ett seed innan du delar datan.
Den här övningen är en del av kursen
Maskininlärning med Tidyverse
Övningsinstruktioner
- Dela upp datan i 75 % träning och 25 % test med funktionen
initial_split()och tilldela resultatet tillgap_split. - Extrahera träningsdataramen från
gap_splitmed funktionentraining(). - Extrahera testdataramen från
gap_splitmed funktionentesting(). - Kontrollera att dimensionerna för dina nya dataramar stämmer med förväntningarna genom att använda
dim()påtraining_dataochtesting_data.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
set.seed(42)
# Prepare the initial split object
gap_split <- initial_split(___, prop = ___)
# Extract the training data frame
training_data <- ___
# Extract the testing data frame
testing_data <- ___
# Calculate the dimensions of both training_data and testing_data
dim(___)
dim(___)