Anatomie d'un modèle de Machine Learning
Vous allez maintenant renforcer votre compréhension de l'influence des données sur la performance du modèle. Vous utiliserez le jeu de données de réservation Airbnb (dans le fichier booking.csv). Ce jeu de données convient à une tâche de classification visant à prédire si une personne annulera une réservation. Il contient plusieurs colonnes numériques et catégorielles.
Vous diviserez le jeu de données fourni en trois échantillons mutuellement exclusifs — train_A.csv, train_B.csv et test.csv — à l'aide du script split_dataset.py. Ensuite, pour chacun des jeux d'entraînement, vous exécuterez le pipeline de traitement des données et d'entraînement du modèle pour entraîner un classificateur Random Forest et évaluer sa performance sur l'ensemble de test à l'aide de model_training.py. Les hyperparamètres définis dans params.json sont identiques pour les deux exécutions.
Les scripts Python sont conçus pour accepter des arguments en ligne de commande et s'exécuter dans le shell. N'hésitez pas à explorer ces scripts pour approfondir votre compréhension.
Cette activité fait partie du cours
Introduction au contrôle de versions des données avec DVC
Exercice interactif pratique
Passez de la théorie à l’action grâce à l’un de nos exercices interactifs
Commencer l’exercice