Pickle-uri
A venit momentul să trimiți primul tău model în producție. Este un clasificator de tip random forest, pe care îl vei folosi ca punct de referință în timp ce lucrezi la o alternativă mai bună. Ai acces la datele împărțite în seturi de antrenament și testare, cu numele lor obișnuite: X_train, X_test, y_train și y_test, precum și la modulele RandomForestClassifier() și pickle, ale căror metode .load() și .dump() le vei folosi în acest exercițiu.
Acest exercițiu face parte din cursul
Proiectarea fluxurilor de lucru pentru Machine Learning în Python
Instrucțiuni pentru exercițiu
- Antrenează un clasificator de tip random forest pe date. Fixează seed-ul aleatoriu la 42 pentru a te asigura că rezultatele sunt reproductibile.
- Scrie modelul în fișier folosind pickle. Deschide fișierul destinație cu sintaxa
with open(____) as ____. - Acum încarcă modelul din fișier într-o variabilă cu un alt nume,
clf_from_file. - Stochează predicțiile modelului încărcat într-o variabilă numită
preds.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Fit a random forest to the training set
clf = ____(____=42).____(
X_train, y_train)
# Save it to a file, to be pushed to production
with ____('model.pkl', ____) as ____:
pickle.____(clf, file=file)
# Now load the model from file in the production environment
with ____ as file:
clf_from_file = pickle.____(file)
# Predict the labels of the test dataset
preds = clf_from_file.____