Zacznij terazZacznij za darmo

Podział danych na zbiór treningowy i testowy

Czas zbudować kompletny model uczenia maszynowego, wykonując kilka prostych kroków! Szczegóły dotyczące modelowania omówimy dokładniej w kolejnych rozdziałach, ale na razie przećwiczysz i poznasz kluczowe etapy tego procesu.

Niezależne cechy zostały wczytane jako obiekt pandas DataFrame o nazwie X, a wartości zależne jako obiekt pandas Series o nazwie Y.

Funkcja train_test_split z biblioteki sklearn jest już zaimportowana. Teraz stworzysz zbiory treningowy i testowy, a następnie sprawdzisz, czy dane zostały poprawnie podzielone.

To ćwiczenie jest częścią kursu

Uczenie maszynowe w marketingu w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Podziel X i Y na zbiory treningowy i testowy, przeznaczając 25% danych do testowania.
  • Upewnij się, że zbiór treningowy zawiera tylko 75% oryginalnych danych.
  • Upewnij się, że zbiór testowy zawiera tylko 25% oryginalnych danych.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Split X and Y into training and testing datasets
train_X, test_X, train_Y, test_Y = ___(___, ___, test_size=0.___)

# Ensure training dataset has only 75% of original X data
print(___.shape[0] / X.shape[0])

# Ensure testing dataset has only 25% of original X data
print(___.shape[0] / ___.shape[0])
Edytuj i uruchom kod