Din första pipeline
Din kollega har använt AdaBoostClassifier för kreditbedömningsdatamängden. Du vill nu prova en random forest-klassificerare. I den här övningen tränar du den klassificeraren på data och jämför den med AdaBoostClassifier. Se till att dela upp data i tränings- och testmängder för att undvika överanpassning. Data är förinstallerad och transformerad så att alla särdrag är numeriska. Särdragen finns tillgängliga som X och etiketterna som y. Modulen RandomForestClassifier är också förinstallerad.
Den här övningen är en del av kursen
Att designa maskininlärningsflöden i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Split the data into train and test, with 20% as test
X_train, ____, ____, y_test = train_test_split(
X, y, ____=0.2, random_state=1)