Dela upp data i träning och testning
Sista steget innan vi går vidare till att bygga regressionsmodellen! Här identifierar du namnen på målvariabeln och särdragskolumnerna, extraherar data och delar upp dem i tränings- och testdata.
Biblioteken pandas och numpy har laddats in som pd respektive np. Indatasärdragen är importerade som datamängden features, och målvariabeln du byggde i föregående övning har importerats åt dig som Y.
Den här övningen är en del av kursen
Maskininlärning för marknadsföring i Python
Övningsinstruktioner
- Lagra namnet på kundidentifierarkolumnen som en lista.
- Välj ut särdragskolumnernas namn och exkludera kundidentifierarkolumnen.
- Extrahera särdragen som
X. - Dela upp data i träning och testning med funktionen
train_test_split().
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Store customer identifier column name as a list
custid = ['___']
# Select feature column names excluding customer identifier
cols = [col for col in features.___ if col not in ___]
# Extract the features as `X`
X = features[___]
# Split data to training and testing
___, test_X, train_Y, ___ = ___(X, Y, test_size=0.25, random_state=99)