scikit-learn では、教師あり学習モデルを使って新しいデータの目的変数を予測するための、再現性の高いワークフローが提供されています。
以下の擬似コードを正しい順序に並べ替えて、教師あり学習モデルの構築から予測までのワークフローを正確に示してください。
この演習はコースの一部です
理論を実践に変える、インタラクティブな演習のひとつをお試しください
この章では、分類問題を紹介し、教師あり学習の手法を使ってそれを解く方法を学びます。データを訓練セットとテストセットに分割し、モデルを適合させ、予測を行い、精度を評価する方法を習得します。また、モデルの複雑さと性能の関係を理解し、通信会社の顧客の解約状況を分類するチャーンデータセットに応用します。
現在の演習
この章では、回帰を紹介し、広告費のデータセットを使って、売上値を予測するモデルを構築します。線形回帰の仕組みや、決定係数(R²)や平均二乗誤差の平方根(RMSE)といった代表的な評価指標について学びます。また、k 分割交差検証を実施し、過学習のリスクを低減するために回帰モデルに正則化を適用します。
モデルの訓練が完了したら、今度はその評価方法を学びましょう。この章では、scikit-learn を使った分類モデルの性能分析に役立つ複数の評価指標と可視化手法を紹介します。また、ハイパーパラメータのチューニングを通じて、分類モデルと回帰モデルを最適化する方法も学びます。
欠損値の補完、カテゴリデータの数値変換、データのスケーリング、複数の教師あり学習モデルの同時評価、そしてワークフローを効率化するパイプラインの構築方法を学びましょう。