Pickle
いよいよ最初のモデルを本番環境にプッシュします。今回はランダムフォレスト分類器をベースラインとして使い、その間により良い代替モデルの開発を進めます。学習用とテスト用に分割されたデータは、X_train、X_test、y_train、y_test の通常の名前で利用できます。また、この演習では RandomForestClassifier() と pickle モジュールにアクセスでき、.load() と .dump() メソッドを使用します。
この演習はコースの一部です
Python で設計する Machine Learning ワークフロー
演習の手順
- ランダムフォレスト分類器をデータに学習させます。結果の再現性を確保するため、乱数シードは 42 に固定してください。
- pickle を使ってモデルをファイルに書き出します。
with open(____) as ____構文で出力先ファイルを開いてください。 - 次に、ファイルからモデルを別の変数名
clf_from_fileに読み込みます。 - 読み込んだモデルで予測を行い、結果を変数
predsに保存します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Fit a random forest to the training set
clf = ____(____=42).____(
X_train, y_train)
# Save it to a file, to be pushed to production
with ____('model.pkl', ____) as ____:
pickle.____(clf, file=file)
# Now load the model from file in the production environment
with ____ as file:
clf_from_file = pickle.____(file)
# Predict the labels of the test dataset
preds = clf_from_file.____