Împărțirea datelor în antrenament și testare
Ultimul pas înainte de a construi modelul de regresie! Aici vei identifica numele variabilei țintă și ale coloanelor de caracteristici, vei extrage datele și le vei împărți în seturi de antrenament și de testare.
Bibliotecile pandas și numpy au fost importate ca pd, respectiv np. Caracteristicile de intrare sunt importate ca setul de date features, iar variabila țintă construită în exercițiul anterior a fost importată pentru tine ca Y.
Acest exercițiu face parte din cursul
Machine Learning pentru Marketing în Python
Instrucțiuni pentru exercițiu
- Stochează numele coloanei de identificare a clientului ca listă.
- Selectează numele coloanelor de caracteristici excluzând coloana de identificare a clientului.
- Extrage caracteristicile ca
X. - Împarte datele în antrenament și testare folosind funcția
train_test_split().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Store customer identifier column name as a list
custid = ['___']
# Select feature column names excluding customer identifier
cols = [col for col in features.___ if col not in ___]
# Extract the features as `X`
X = features[___]
# Split data to training and testing
___, test_X, train_Y, ___ = ___(X, Y, test_size=0.25, random_state=99)