Rozdělení dat na trénovací a testovací
Poslední krok před tím, než se pustíme do tvorby regresního modelu! Identifikuješ názvy cílové proměnné a sloupců příznaků, extrahuješ data a rozdělíš je na trénovací a testovací část.
Knihovny pandas a numpy jsou načteny jako pd a np. Vstupní příznaky jsou importovány jako dataset features a cílová proměnná, kterou jsi sestavil/a v předchozím cvičení, je importována jako Y.
Toto cvičení je součástí kurzu
Machine Learning for Marketing in Python
Pokyny k cvičení
- Ulož název sloupce s identifikátorem zákazníka jako seznam.
- Vyber názvy sloupců příznaků s vyloučením sloupce identifikátoru zákazníka.
- Extrahuj příznaky jako
X. - Rozděl data na trénovací a testovací část pomocí funkce
train_test_split().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Store customer identifier column name as a list
custid = ['___']
# Select feature column names excluding customer identifier
cols = [col for col in features.___ if col not in ___]
# Extract the features as `X`
X = features[___]
# Split data to training and testing
___, test_X, train_Y, ___ = ___(X, Y, test_size=0.25, random_state=99)