Zacznij terazZacznij za darmo

Podział danych na zbiór treningowy i testowy

Ostatni krok przed budową modelu regresji! Zidentyfikujesz nazwy zmiennej docelowej i kolumn cech, wyodrębnisz dane, a następnie podzielisz je na zbiór treningowy i testowy.

Biblioteki pandas i numpy zostały wczytane odpowiednio jako pd i np. Cechy wejściowe są zaimportowane jako zbiór danych features, a zmienna docelowa zbudowana w poprzednim ćwiczeniu — jako Y.

To ćwiczenie jest częścią kursu

Uczenie maszynowe w marketingu w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zapisz nazwę kolumny identyfikatora klienta jako listę.
  • Wybierz nazwy kolumn cech, wykluczając kolumnę identyfikatora klienta.
  • Wyodrębnij cechy jako X.
  • Podziel dane na zbiór treningowy i testowy, używając funkcji train_test_split().

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Store customer identifier column name as a list
custid = ['___']

# Select feature column names excluding customer identifier
cols = [col for col in features.___ if col not in ___]

# Extract the features as `X`
X = features[___]

# Split data to training and testing
___, test_X, train_Y, ___ = ___(X, Y, test_size=0.25, random_state=99)
Edytuj i uruchom kod