CommencerCommencez gratuitement

Anatomie d’un modèle de Machine Learning

Vous allez maintenant consolider votre compréhension de l’impact des données sur les performances d’un modèle. Vous travaillerez avec le jeu de données de réservations Airbnb (fichier booking.csv). Ce jeu de données se prête aux tâches de classification pour prédire si une réservation sera annulée. Il contient plusieurs colonnes numériques et catégorielles. Vous allez diviser le jeu de données fourni en trois échantillons mutuellement exclusifs — train_A.csv, train_B.csv et test.csv — à l’aide du script split_dataset.py. Ensuite, pour chacun des jeux d’apprentissage, vous exécuterez la chaîne de traitement des données et d’entraînement du modèle pour entraîner un modèle Random Forest Classifier, puis évaluerez ses performances sur l’ensemble de test avec model_training.py. Les hyperparamètres définis dans params.json sont identiques pour les deux exécutions.

Les scripts Python sont conçus pour accepter des arguments en ligne de commande et s’exécutent via le shell. N’hésitez pas à les explorer pour approfondir votre compréhension.

Cet exercice fait partie du cours

<cours>Introduction au versionnage des données avec DVC</cours>
Voir le cours

Exercice interactif pratique

Transformez la théorie en action avec l’un de nos exercices interactifs

Commencer l’exercice