始める無料で始める

Pickle

いよいよ最初のモデルを本番環境にプッシュします。今回はランダムフォレスト分類器をベースラインとして使い、その間により良い代替モデルの開発を進めます。学習用とテスト用に分割されたデータは、X_trainX_testy_trainy_test の通常の名前で利用できます。また、この演習では RandomForestClassifier()pickle モジュールにアクセスでき、.load().dump() メソッドを使用します。

この演習はコースの一部です

Python で設計する Machine Learning ワークフロー

コースを見る

演習の手順

  • ランダムフォレスト分類器をデータに学習させます。結果の再現性を確保するため、乱数シードは 42 に固定してください。
  • pickle を使ってモデルをファイルに書き出します。with open(____) as ____ 構文で出力先ファイルを開いてください。
  • 次に、ファイルからモデルを別の変数名 clf_from_file に読み込みます。
  • 読み込んだモデルで予測を行い、結果を変数 preds に保存します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Fit a random forest to the training set
clf = ____(____=42).____(
  X_train, y_train)

# Save it to a file, to be pushed to production
with ____('model.pkl', ____) as ____:
    pickle.____(clf, file=file)

# Now load the model from file in the production environment
with ____ as file:
    clf_from_file = pickle.____(file)

# Predict the labels of the test dataset
preds = clf_from_file.____
コードを編集して実行