Ponowne próbkowanie danych
Pierwszym krokiem w projekcie uczenia maszynowego jest stworzenie zbiorów treningowego i testowego – służą one do dopasowania i oceny modelu. Zbiór testowy daje oszacowanie tego, jak model poradzi sobie z nowymi danymi, i pomaga uniknąć nadmiernego dopasowania.
Będziesz pracować ze zbiorem danych telecom_df, który zawiera informacje o klientach firmy telekomunikacyjnej. Zmienna docelowa to canceled_service – rejestruje, czy dany klient rozwiązał umowę z firmą. Zmienne predykcyjne zawierają informacje o wykorzystaniu telefonu komórkowego i Internetu przez klientów, a także o typie umowy i miesięcznych opłatach.
Tibble telecom_df został wczytany do twojej sesji.
To ćwiczenie jest częścią kursu
Modelowanie z tidymodels w R
Instrukcje do ćwiczenia
- Utwórz obiekt
rsampleo nazwietelecom_split, który zawiera instrukcje losowego podziału danychtelecom_dfna zbiór treningowy i testowy.- Przeznacz 75% danych na zbiór treningowy i zastosuj stratyfikację według zmiennej
canceled_service.
- Przeznacz 75% danych na zbiór treningowy i zastosuj stratyfikację według zmiennej
- Przekaż obiekt
telecom_splitdo odpowiednich funkcji z pakietursample, aby utworzyć zbiory treningowy i testowy. - Sprawdź liczbę wierszy w każdym zbiorze, przekazując je do funkcji
nrow().
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create data split object
telecom_split <- ___(___, prop = ___,
strata = ___)
# Create the training data
telecom_training <- ___ %>%
___
# Create the test data
telecom_test <- ___ %>%
___
# Check the number of rows
nrow(___)
nrow(___)