テストとトレインの違い
データをクリーンアップしてモデリングの準備ができたら、最も重要な手順の一つがデータを「テストデータ」と「トレーニングデータ」に分割することです。その後は、よいモデルができたと思えるまでテストデータには触れないでください。モデルを作り、仮説を立てている間は、トレーニングデータで評価して性能の見当をつけます。
お気に入りのモデルができたら、テストデータで新しいデータに対する予測精度を確認します。まだ一度も見ていないこのデータは、実際に新しいデータを予測・分類する場面で、モデルがどの程度うまく機能するかをより現実的に示してくれます。
Spark では、すべての変換を終えた「後」にデータを分割することが重要です。これは、StringIndexer のような操作は、同じ文字列のリストを与えても常に同じインデックスを生成するとは限らないためです。
モデル評価でテストデータを使うことが重要なのはなぜでしょうか?
この演習はコースの一部です
