Tvůj první pipeline
Tvůj kolega použil pro dataset kreditního scoringu AdaBoostClassifier. Ty chceš vyzkoušet také klasifikátor náhodného lesa. V tomto cvičení ho natrénuješ na datech a porovnáš s AdaBoostClassifier. Nezapomeň použít rozdělení na trénovací a testovací sadu, aby ses vyhnul/a přeučení. Data jsou předem načtena a transformována tak, aby všechny příznaky byly numerické. Příznaky jsou dostupné jako X a štítky jako y. Modul RandomForestClassifier je také předem načten.
Toto cvičení je součástí kurzu
Designing Machine Learning Workflows in Python
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Split the data into train and test, with 20% as test
X_train, ____, ____, y_test = train_test_split(
X, y, ____=0.2, random_state=1)