Podział na zbiór treningowy i testowy
W rzetelnym procesie uczenia maszynowego kluczowe jest wyłączenie części danych (danych testowych) z wszelkich decyzji podejmowanych podczas budowania modelu. Dzięki temu możesz niezależnie ocenić jego wydajność po zakończeniu pracy. Pozostała część danych – dane treningowe – służy do budowania i wyboru najlepszego modelu.
W tym ćwiczeniu użyjesz pakietu rsample, aby podzielić dane gapminder na zbiór treningowy i testowy.
Uwaga: Ponieważ podział jest losowy, dobrą praktyką jest ustawienie ziarna losowości przed jego wykonaniem.
To ćwiczenie jest częścią kursu
Uczenie maszynowe w tidyverse
Instrukcje do ćwiczenia
- Podziel dane na 75% treningowych i 25% testowych za pomocą funkcji
initial_split()i przypisz wynik dogap_split. - Wyodrębnij ramkę danych treningowych z
gap_splitza pomocą funkcjitraining(). - Wyodrębnij ramkę danych testowych z
gap_splitza pomocą funkcjitesting(). - Sprawdź wymiary nowych ramek danych za pomocą funkcji
dim()na obiektachtraining_dataitesting_data, aby upewnić się, że są zgodne z oczekiwaniami.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
set.seed(42)
# Prepare the initial split object
gap_split <- initial_split(___, prop = ___)
# Extract the training data frame
training_data <- ___
# Extract the testing data frame
testing_data <- ___
# Calculate the dimensions of both training_data and testing_data
dim(___)
dim(___)