Votre première pipeline
Votre collègue a utilisé AdaBoostClassifier pour le jeu de données de cote de crédit. Vous souhaitez aussi essayer un classifieur à forêt aléatoire. Dans cet exercice, vous allez ajuster ce classifieur aux données et le comparer à AdaBoostClassifier. Assurez-vous d'utiliser une division entraînement/test pour éviter le surapprentissage. Les données sont préchargées et transformées de sorte que toutes les variables explicatives soient numériques. Les variables explicatives sont disponibles sous X et les étiquettes sous y. Le module RandomForestClassifier est aussi préchargé.
Cette activité fait partie du cours
Concevoir des flux de travail Machine Learning en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Split the data into train and test, with 20% as test
X_train, ____, ____, y_test = train_test_split(
X, y, ____=0.2, random_state=1)