Fichiers pickle
C'est enfin le moment de déployer votre premier modèle en production. Il s'agit d'un classificateur par forêt aléatoire que vous utiliserez comme référence pendant que vous travaillez à une meilleure solution. Vous avez accès à la division des données en entraînement et test avec leurs noms habituels, X_train, X_test, y_train et y_test, ainsi qu'aux modules RandomForestClassifier() et pickle, dont vous aurez besoin des méthodes .load() et .dump() pour cet exercice.
Cette activité fait partie du cours
Concevoir des flux de travail Machine Learning en Python
Instructions de l’exercice
- Ajustez un classificateur par forêt aléatoire aux données. Fixez la graine aléatoire à 42 pour assurer la reproductibilité des résultats.
- Écrivez le modèle dans un fichier à l'aide de pickle. Ouvrez le fichier de destination avec la syntaxe
with open(____) as ____. - Chargez maintenant le modèle depuis le fichier dans une variable différente,
clf_from_file. - Stockez les prédictions du modèle chargé dans une variable
preds.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Fit a random forest to the training set
clf = ____(____=42).____(
X_train, y_train)
# Save it to a file, to be pushed to production
with ____('model.pkl', ____) as ____:
pickle.____(clf, file=file)
# Now load the model from file in the production environment
with ____ as file:
clf_from_file = pickle.____(file)
# Predict the labels of the test dataset
preds = clf_from_file.____