Pickle soubory
Nastal čas nasadit tvůj první model do produkce. Půjde o klasifikátor náhodného lesa, který poslouží jako základní model (baseline), zatímco stále pracuješ na vývoji lepší alternativy. Máš k dispozici data rozdělená na trénovací a testovací sadu s obvyklými názvy X_train, X_test, y_train a y_test, a také moduly RandomForestClassifier() a pickle, jejichž metody .load() a .dump() budeš v tomto cvičení potřebovat.
Toto cvičení je součástí kurzu
Designing Machine Learning Workflows in Python
Pokyny k cvičení
- Natrénuj klasifikátor náhodného lesa na datech. Nastav náhodný seed na hodnotu 42, aby byly výsledky reprodukovatelné.
- Ulož model do souboru pomocí pickle. Otevři cílový soubor syntaxí
with open(____) as ____. - Načti model ze souboru do jiné proměnné s názvem
clf_from_file. - Ulož predikce načteného modelu do proměnné
preds.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Fit a random forest to the training set
clf = ____(____=42).____(
X_train, y_train)
# Save it to a file, to be pushed to production
with ____('model.pkl', ____) as ____:
pickle.____(clf, file=file)
# Now load the model from file in the production environment
with ____ as file:
clf_from_file = pickle.____(file)
# Predict the labels of the test dataset
preds = clf_from_file.____