Separă caracteristicile de variabila țintă
Acum că ai împărțit datele în seturi de antrenament și de testare, a venit momentul să efectuezi ultimul pas înainte de antrenarea modelului: separarea caracteristicilor de variabilele țintă în seturi de date distincte. Vei folosi lista de nume de coloane care a fost încărcată pentru tine.
Setul principal de date este încărcat ca telcom și împărțit în seturi de antrenament și de testare, stocate ca DataFrame-uri pandas în train și, respectiv, test. Listele target și custid conțin numele variabilei țintă și, respectiv, ale ID-ului clientului. Va trebui să creezi lista cols cu numele coloanelor rămase. Explorează seturile de date în consolă dacă vrei să înțelegi mai bine structura lor.
Acest exercițiu face parte din cursul
Machine Learning pentru Marketing în Python
Instrucțiuni pentru exercițiu
- Stochează numele coloanelor din
telcomîntr-o listă, excluzând variabila țintă și ID-ul clientului. - Extrage caracteristicile și ținta din setul de antrenament.
- Extrage caracteristicile și ținta din setul de testare.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Store column names from `telcom` excluding target variable and customer ID
cols = [col for col in ___.columns if col not in ___ + target]
# Extract training features
train_X = train[___]
# Extract training target
train_Y = train[___]
# Extract testing features
test_X = test[___]
# Extract testing target
test_Y = test[___]