Pickles
आखिरकार, अब समय है कि आप अपना पहला मॉडल प्रोडक्शन में पुश करें. यह एक random forest classifier है जिसे आप baseline के रूप में उपयोग करेंगे, जब तक आप कोई बेहतर विकल्प विकसित करने पर काम कर रहे हैं. आपके पास training/test में विभाजित डेटा उपलब्ध है, उनके सामान्य नामों X_train, X_test, y_train और y_test के साथ. साथ ही मॉड्यूल RandomForestClassifier() और pickle भी उपलब्ध हैं, जिनकी .load() और .dump() मेथड्स का उपयोग आपको इस अभ्यास में करना होगा.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में मशीन लर्निंग वर्कफ़्लो डिज़ाइन करना
अभ्यास निर्देश
- डेटा पर एक random forest classifier फिट कीजिए. परिणामों की reproducibility सुनिश्चित करने के लिए random seed को 42 पर फिक्स कीजिए.
- मॉडल को pickle की मदद से फ़ाइल में लिखिए. गंतव्य फ़ाइल को
with open(____) as ____सिंटैक्स का उपयोग करके खोलिए. - अब फ़ाइल से मॉडल को एक अलग वैरिएबल नाम
clf_from_fileमें लोड कीजिए. - लोड किए गए मॉडल से प्राप्त प्रेडिक्शंस को
predsवैरिएबल में स्टोर कीजिए.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Fit a random forest to the training set
clf = ____(____=42).____(
X_train, y_train)
# Save it to a file, to be pushed to production
with ____('model.pkl', ____) as ____:
pickle.____(clf, file=file)
# Now load the model from file in the production environment
with ____ as file:
clf_from_file = pickle.____(file)
# Predict the labels of the test dataset
preds = clf_from_file.____