Kom igångKom igång gratis

Omsampling av data

Det första steget i ett maskininlärningsprojekt är att skapa tränings- och testdatamängder för modellträning och utvärdering. Testdatamängden ger en uppskattning av hur modellen presterar på nya data och hjälper till att motverka överanpassning.

Du kommer att arbeta med datamängden telecom_df, som innehåller information om kunder hos ett telekomföretag. Utfallsvariabeln är canceled_service och anger om en kund har avslutat sitt avtal med företaget. Prediktionsvariablerna innehåller information om kundernas användning av mobiltelefon och internet samt avtalstyp och månadskostnad.

Tibble:n telecom_df har laddats in i din session.

Den här övningen är en del av kursen

Modellering med tidymodels i R

Visa kurs

Övningsinstruktioner

  • Skapa ett rsample-objekt, telecom_split, som innehåller instruktionerna för att slumpmässigt dela upp telecom_df-data i tränings- och testdatamängder.
    • Tilldela 75 % av datan till träning och stratifiera resultaten efter canceled_service.
  • Skicka telecom_split-objektet till lämpliga rsample-funktioner för att skapa tränings- och testdatamängderna.
  • Kontrollera antalet rader i varje datamängd genom att skicka dem till funktionen nrow().

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create data split object
telecom_split <- ___(___, prop = ___,
                     strata = ___)

# Create the training data
telecom_training <- ___ %>% 
  ___

# Create the test data
telecom_test <- ___ %>% 
  ___

# Check the number of rows
nrow(___)
nrow(___)
Redigera och kör kod