Podział danych na zbiór treningowy i testowy
Czas zbudować kompletny model uczenia maszynowego, wykonując kilka prostych kroków! Szczegóły dotyczące modelowania omówimy dokładniej w kolejnych rozdziałach, ale na razie przećwiczysz i poznasz kluczowe etapy tego procesu.
Niezależne cechy zostały wczytane jako obiekt pandas DataFrame o nazwie X, a wartości zależne jako obiekt pandas Series o nazwie Y.
Funkcja train_test_split z biblioteki sklearn jest już zaimportowana. Teraz stworzysz zbiory treningowy i testowy, a następnie sprawdzisz, czy dane zostały poprawnie podzielone.
To ćwiczenie jest częścią kursu
Uczenie maszynowe w marketingu w Pythonie
Instrukcje do ćwiczenia
- Podziel
XiYna zbiory treningowy i testowy, przeznaczając 25% danych do testowania. - Upewnij się, że zbiór treningowy zawiera tylko 75% oryginalnych danych.
- Upewnij się, że zbiór testowy zawiera tylko 25% oryginalnych danych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Split X and Y into training and testing datasets
train_X, test_X, train_Y, test_Y = ___(___, ___, test_size=0.___)
# Ensure training dataset has only 75% of original X data
print(___.shape[0] / X.shape[0])
# Ensure testing dataset has only 25% of original X data
print(___.shape[0] / ___.shape[0])