ÎncepețiÎncepe gratuit

Împărțirea datelor în antrenament și testare

Ultimul pas înainte de a construi modelul de regresie! Aici vei identifica numele variabilei țintă și ale coloanelor de caracteristici, vei extrage datele și le vei împărți în seturi de antrenament și de testare.

Bibliotecile pandas și numpy au fost importate ca pd, respectiv np. Caracteristicile de intrare sunt importate ca setul de date features, iar variabila țintă construită în exercițiul anterior a fost importată pentru tine ca Y.

Acest exercițiu face parte din cursul

Machine Learning pentru Marketing în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Stochează numele coloanei de identificare a clientului ca listă.
  • Selectează numele coloanelor de caracteristici excluzând coloana de identificare a clientului.
  • Extrage caracteristicile ca X.
  • Împarte datele în antrenament și testare folosind funcția train_test_split().

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Store customer identifier column name as a list
custid = ['___']

# Select feature column names excluding customer identifier
cols = [col for col in features.___ if col not in ___]

# Extract the features as `X`
X = features[___]

# Split data to training and testing
___, test_X, train_Y, ___ = ___(X, Y, test_size=0.25, random_state=99)
Editează și rulează codul