2つ(学習とテスト)ではなく、3つ(学習、検証、テスト)のデータセットをいつ使うべきかを理解することは重要です。使わないのに追加の分割を作成しても意味がありません。
学習、検証、そしてテスト用のデータセットを検討すべきなのは、どのようなときでしょうか?
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
モデルを検証する前に、まずはモデルの作成と扱い方を理解する必要があります。本章では、scikit-learn を使った回帰モデルと分類モデルの実行方法を紹介します。ここで学ぶモデル構築の基礎は、以降の章でも繰り返し活用していきます。
この章では、モデル検証の基本に焦点を当てます。データを学習・検証・テスト用に分割する方法から、バイアス–バリアンストレードオフの理解までを扱い、第3章で実践する K-Fold や Leave-One-Out 検証の土台を築きます。
現在の演習
ホールドアウトセットは、モデル検証の良い出発点です。ただし、単一の学習・テスト分割だけでは不十分なことがよくあります。クロスバリデーションはモデル性能の検証における標準的手法とされ、ハイパーパラメータのチューニングでもほぼ必ず使われます。この章では、クロスバリデーションを実行してモデルの性能を検証する方法に焦点を当てます。
最初の3章ではモデル検証の手法に焦点を当てました。第4章では、特にクロスバリデーションを使いながら、ハイパーパラメータチューニングを学び、これらの手法を実際に適用します。検証があるからこそチューニングが可能になり、全体として最良のモデルを選択できるのです。