or
この演習はコースの一部です
この章では、教師あり学習ワークフローの基本を復習します。モデルの学習、チューニングと選択、特徴量エンジニアリングと選択、データ分割の手法まで一通り押さえます。ワークフロー内の各ステップが互いにどう依存し合うか、そしてそれぞれが過学習(データサイエンティストの最大の敵)を招くことも防ぐこともある点を理解します。章末には、教師あり学習に自信を持って取り組めるようになり、以降の章でより高度な内容に進む準備が整います。
前章では、標準的な教師あり学習ワークフローの知識を磨き上げました。今章では、専門家の知見を教師あり学習に取り込む方法を批判的に検討します。これは、適切な分析単位を特定すること(複数データソースにまたがる特徴量エンジニアリングを要する場合があります)、必ずしも完璧ではないラベリングのプロセス、そして Machine Learning モデルが犯す誤りの真のビジネス価値を捉える損失関数の設計によって実現します。
現在の演習
前章では、専門家からのフィードバックをワークフローに取り入れ、ビジネス価値に即した方法で評価しました。ここからは、モデルをプロダクションに適用し、その後も継続的に高い性能を保てるよう反復的に改善するスキルを実践します。さらに、データセットシフトを診断し、環境の変化がモデル精度に及ぼす影響を軽減する方法も学びます。
これまでの章で、教師あり学習の確かな基礎と、本番デプロイに関する知識を身につけてきましたが、常にラベル付きデータがあることを前提としていました。この章では、ラベルが全くない、あるいはごくわずかなデータを扱う課題に挑みます。これは、教師なしの手法である異常検知や、ラベルの代わりにサンプル間の類似性に関する考え方を用いる距離ベース学習へとあなたを導き、教師ありワークフローに匹敵する精度を目指します。この章を終えるころには、現実世界でよくある課題を乗り越えるためにワークフローをどう調整すべきか、適切なツールを自信を持って選べるデータサイエンティストとして一段と際立つ存在になっています。