or
この演習はコースの一部です
SparkはBig Dataを扱うためのフレームワークです。本章では、SparkとMachine Learningの基礎を確認します。続いて、PythonからSparkに接続し、CSVデータを読み込む方法を学びます。
現在の演習
Sparkへのデータ取り込みに慣れたら、2種類の分類モデル――決定木とロジスティック回帰――の構築に進みます。あわせて、データ準備のいくつかの手法についても学びます。
次に、線形回帰モデルの作成方法を学びます。さらに、新しい予測変数を作る特徴量エンジニアリングや、最も関連性の高い予測変数だけを選ぶ堅牢な手法についても扱います。
最後に、モデルをより効率的にする方法を学びます。コードをわかりやすく保守しやすくするパイプラインの使い方を理解し、クロスバリデーションでモデルをより適切に評価して良いハイパーパラメータを選びます。最後に、2種類のアンサンブルモデルも体験します。