Logistic Regression モデルを構築する
すでにフライトデータで Decision Tree モデルを作成しました。次は同じデータで Logistic Regression モデルを作りましょう。
目的は、フライトが少なくとも15分遅延する可能性が高いか(ラベル 1)、そうでないか(ラベル 0)を予測することです。
利用できる予測変数はいくつかありますが、ここではまず mon、depart、duration 列だけを使います。これらは数値特徴量なので、そのまま Logistic Regression モデルに利用できます。カテゴリ型の特徴量を含めるには、もう少し準備が必要です。続けていきましょう!
データは学習用とテスト用に分割されており、flights_train と flights_test として利用できます。
この演習はコースの一部です
Machine Learning with PySpark
演習の手順
- Logistic Regression 分類器を作成するためのクラスをインポートします。
- 分類器オブジェクトを作成し、学習データで学習させます。
- テストデータで予測を行い、混同行列を作成します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import the logistic regression class
from pyspark.ml.____ import ____
# Create a classifier object and train on training data
logistic = ____().____(____)
# Create predictions for the testing data and show confusion matrix
prediction = ____.____(____)
prediction.groupBy(____, ____).____().show()