Podział danych na zbiór treningowy i testowy
Ostatni krok przed budową modelu regresji! Zidentyfikujesz nazwy zmiennej docelowej i kolumn cech, wyodrębnisz dane, a następnie podzielisz je na zbiór treningowy i testowy.
Biblioteki pandas i numpy zostały wczytane odpowiednio jako pd i np. Cechy wejściowe są zaimportowane jako zbiór danych features, a zmienna docelowa zbudowana w poprzednim ćwiczeniu — jako Y.
To ćwiczenie jest częścią kursu
Uczenie maszynowe w marketingu w Pythonie
Instrukcje do ćwiczenia
- Zapisz nazwę kolumny identyfikatora klienta jako listę.
- Wybierz nazwy kolumn cech, wykluczając kolumnę identyfikatora klienta.
- Wyodrębnij cechy jako
X. - Podziel dane na zbiór treningowy i testowy, używając funkcji
train_test_split().
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Store customer identifier column name as a list
custid = ['___']
# Select feature column names excluding customer identifier
cols = [col for col in features.___ if col not in ___]
# Extract the features as `X`
X = features[___]
# Split data to training and testing
___, test_X, train_Y, ___ = ___(X, Y, test_size=0.25, random_state=99)