Machine Learning パイプライン
次の2章では、データの取り込みからモデル評価まで、Machine Learning パイプラインの各ステージを順に体験します。さっそく始めましょう!
pyspark.ml モジュールの中心にあるのは、Transformer クラスと Estimator クラスです。モジュールに含まれるほとんどのクラスは、この2つの基本クラスと同様のふるまいをします。
Transformer クラスは、.transform() メソッドを持ち、DataFrame を受け取って新しい DataFrame を返します。多くの場合、元の DataFrame に新しい列を追加したものを返します。たとえば、連続変数から離散的なビンを作る Bucketizer クラスや、主成分分析でデータセットの次元を削減する PCA クラスが該当します。
Estimator クラスはすべて .fit() メソッドを実装しています。これらのメソッドも DataFrame を受け取りますが、別の DataFrame を返すのではなく、モデルオブジェクトを返します。たとえば、文字列として保存されたカテゴリカルデータをモデルに取り込むための StringIndexerModel や、分類や回帰にランダムフォレストアルゴリズムを用いる RandomForestModel などです。
次のうち、Spark の Machine Learning についての記述で正しく「ない」ものはどれですか?
この演習はコースの一部です
