Omsampling av data
Det första steget i ett maskininlärningsprojekt är att skapa tränings- och testdatamängder för modellträning och utvärdering. Testdatamängden ger en uppskattning av hur modellen presterar på nya data och hjälper till att motverka överanpassning.
Du kommer att arbeta med datamängden telecom_df, som innehåller information om kunder hos ett telekomföretag. Utfallsvariabeln är canceled_service och anger om en kund har avslutat sitt avtal med företaget. Prediktionsvariablerna innehåller information om kundernas användning av mobiltelefon och internet samt avtalstyp och månadskostnad.
Tibble:n telecom_df har laddats in i din session.
Den här övningen är en del av kursen
Modellering med tidymodels i R
Övningsinstruktioner
- Skapa ett
rsample-objekt,telecom_split, som innehåller instruktionerna för att slumpmässigt dela upptelecom_df-data i tränings- och testdatamängder.- Tilldela 75 % av datan till träning och stratifiera resultaten efter
canceled_service.
- Tilldela 75 % av datan till träning och stratifiera resultaten efter
- Skicka
telecom_split-objektet till lämpligarsample-funktioner för att skapa tränings- och testdatamängderna. - Kontrollera antalet rader i varje datamängd genom att skicka dem till funktionen
nrow().
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create data split object
telecom_split <- ___(___, prop = ___,
strata = ___)
# Create the training data
telecom_training <- ___ %>%
___
# Create the test data
telecom_test <- ___ %>%
___
# Check the number of rows
nrow(___)
nrow(___)