CommencezCommencez gratuitement

Fichiers pickle

C'est enfin le moment de déployer votre premier modèle en production. Il s'agit d'un classificateur par forêt aléatoire que vous utiliserez comme référence pendant que vous travaillez à une meilleure solution. Vous avez accès à la division des données en entraînement et test avec leurs noms habituels, X_train, X_test, y_train et y_test, ainsi qu'aux modules RandomForestClassifier() et pickle, dont vous aurez besoin des méthodes .load() et .dump() pour cet exercice.

Cette activité fait partie du cours

Concevoir des flux de travail Machine Learning en Python

Voir le cours

Instructions de l’exercice

  • Ajustez un classificateur par forêt aléatoire aux données. Fixez la graine aléatoire à 42 pour assurer la reproductibilité des résultats.
  • Écrivez le modèle dans un fichier à l'aide de pickle. Ouvrez le fichier de destination avec la syntaxe with open(____) as ____.
  • Chargez maintenant le modèle depuis le fichier dans une variable différente, clf_from_file.
  • Stockez les prédictions du modèle chargé dans une variable preds.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Fit a random forest to the training set
clf = ____(____=42).____(
  X_train, y_train)

# Save it to a file, to be pushed to production
with ____('model.pkl', ____) as ____:
    pickle.____(clf, file=file)

# Now load the model from file in the production environment
with ____ as file:
    clf_from_file = pickle.____(file)

# Predict the labels of the test dataset
preds = clf_from_file.____
Modifier et exécuter le code