Dela upp data i tränings- och testuppsättningar
Nu är du redo att bygga en komplett maskininlärningsmodell genom att följa några enkla steg! Du kommer att utforska modelleringsdetaljer mer ingående i nästa kapitel, men här får du öva på och förstå de viktigaste stegen.
De oberoende särdragen har laddats in som en pandas DataFrame med namnet X, och de beroende värdena som en pandas Series med namnet Y.
Funktionen train_test_split har också laddats in från biblioteket sklearn. Du ska nu skapa tränings- och testdatamängder och kontrollera att uppdelningen gick rätt till.
Den här övningen är en del av kursen
Maskininlärning för marknadsföring i Python
Övningsinstruktioner
- Dela upp
XochYi tränings- och testuppsättningar, där 25 % av datan används för testning. - Kontrollera att träningsdatamängden innehåller 75 % av den ursprungliga datan.
- Kontrollera att testdatamängden innehåller 25 % av den ursprungliga datan.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Split X and Y into training and testing datasets
train_X, test_X, train_Y, test_Y = ___(___, ___, test_size=0.___)
# Ensure training dataset has only 75% of original X data
print(___.shape[0] / X.shape[0])
# Ensure testing dataset has only 25% of original X data
print(___.shape[0] / ___.shape[0])