Gradient-Boosted Trees による遅延フライトの判定
これまでに、Decision Tree を使って遅延しやすいフライトを判定する分類器を作成しました。この演習では、Decision Tree モデルと Gradient-Boosted Trees モデルを比較します。
フライトのデータはランダムに flights_train と flights_test に分割されています。
この演習はコースの一部です
Machine Learning with PySpark
演習の手順
- Decision Tree と Gradient-Boosted Tree の分類器を作成するために必要なクラスをインポートします。
- Decision Tree と Gradient-Boosted Tree の分類器を作成し、学習用データで訓練します。
- 評価器を作成し、両方の分類器についてテストデータで AUC を計算します。どちらのモデルがより高性能ですか?
- Gradient-Boosted Tree 分類器について、木の本数と特徴量の相対的重要度を出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the classes required
from pyspark.ml.____ import ____, ____
from pyspark.ml.evaluation import BinaryClassificationEvaluator
# Create model objects and train on training data
tree = ____().____(____)
gbt = ____().____(____)
# Compare AUC on testing data
evaluator = ____()
print(evaluator.____(tree.____(____)))
print(evaluator.____(gbt.____(____)))
# Find the number of trees and the relative importance of features
print(gbt.____)
print(gbt.____)