始める無料で始める

Machine Learningモデルの構成要素

ここでは、データがモデル性能にどのように影響するかを確認して理解を深めます。扱うのはAirbnbの予約データセット(ファイル名はbooking.csv)です。このデータセットは、予約がキャンセルされるかどうかを予測する分類タスクに適しており、数値列とカテゴリ列の両方を含みます。 提供されたデータセットを、互いに重ならない3つのサンプル(train_A.csvtrain_B.csvtest.csv)に、split_dataset.pyスクリプトを使って分割します。続いて、各トレーニングデータに対してデータ処理とモデル学習のパイプラインを実行し、Random Forest Classifierモデルを学習します。そしてmodel_training.pyを使ってテストセット上で性能を評価します。params.jsonで定義されたハイパーパラメータは、両方の実行で同一です。

これらのPythonスクリプトはコマンドライン引数を受け取り、シェルから実行できるように設計されています。理解を深めるために、自由にスクリプトの中身も確認してみてください。

この演習はコースの一部です

DVCによるデータバージョニング入門

コースを見る

実践的なインタラクティブ演習

理論を実践に変える、インタラクティブな演習のひとつをお試しください

演習を開始する