Začněte nyníZačněte zdarma

Rozdělení dat na trénovací a testovací

Poslední krok před tím, než se pustíme do tvorby regresního modelu! Identifikuješ názvy cílové proměnné a sloupců příznaků, extrahuješ data a rozdělíš je na trénovací a testovací část.

Knihovny pandas a numpy jsou načteny jako pd a np. Vstupní příznaky jsou importovány jako dataset features a cílová proměnná, kterou jsi sestavil/a v předchozím cvičení, je importována jako Y.

Toto cvičení je součástí kurzu

Machine Learning for Marketing in Python

Zobrazit kurz

Pokyny k cvičení

  • Ulož název sloupce s identifikátorem zákazníka jako seznam.
  • Vyber názvy sloupců příznaků s vyloučením sloupce identifikátoru zákazníka.
  • Extrahuj příznaky jako X.
  • Rozděl data na trénovací a testovací část pomocí funkce train_test_split().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Store customer identifier column name as a list
custid = ['___']

# Select feature column names excluding customer identifier
cols = [col for col in features.___ if col not in ___]

# Extract the features as `X`
X = features[___]

# Split data to training and testing
___, test_X, train_Y, ___ = ___(X, Y, test_size=0.25, random_state=99)
Upravit a spustit kód