始める無料で始める

Logistic Regression モデルを構築する

すでにフライトデータで Decision Tree モデルを作成しました。次は同じデータで Logistic Regression モデルを作りましょう。

目的は、フライトが少なくとも15分遅延する可能性が高いか(ラベル 1)、そうでないか(ラベル 0)を予測することです。

利用できる予測変数はいくつかありますが、ここではまず mondepartduration 列だけを使います。これらは数値特徴量なので、そのまま Logistic Regression モデルに利用できます。カテゴリ型の特徴量を含めるには、もう少し準備が必要です。続けていきましょう!

データは学習用とテスト用に分割されており、flights_trainflights_test として利用できます。

この演習はコースの一部です

Machine Learning with PySpark

コースを見る

演習の手順

  • Logistic Regression 分類器を作成するためのクラスをインポートします。
  • 分類器オブジェクトを作成し、学習データで学習させます。
  • テストデータで予測を行い、混同行列を作成します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import the logistic regression class
from pyspark.ml.____ import ____

# Create a classifier object and train on training data
logistic = ____().____(____)

# Create predictions for the testing data and show confusion matrix
prediction = ____.____(____)
prediction.groupBy(____, ____).____().show()
コードを編集して実行