Zacznij terazZacznij za darmo

Budowanie modelu regresji logistycznej

Wcześniej zbudowałeś/zbudowałaś model drzewa decyzyjnego na danych dotyczących lotów. Teraz czas na stworzenie modelu regresji logistycznej na tych samych danych.

Celem jest przewidzenie, czy dany lot z dużym prawdopodobieństwem opóźni się o co najmniej 15 minut (etykieta 1), czy nie (etykieta 0).

Chociaż masz do dyspozycji wiele zmiennych predykcyjnych, na razie skorzystasz tylko z kolumn mon, depart i duration. Są to cechy numeryczne, które można bezpośrednio wykorzystać w modelu regresji logistycznej. Zanim będzie można dodać cechy kategoryczne, trzeba będzie wykonać kilka dodatkowych kroków. Szczegóły już wkrótce!

Dane zostały podzielone na zbiory treningowy i testowy, dostępne jako flights_train i flights_test.

To ćwiczenie jest częścią kursu

Uczenie maszynowe z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj klasę służącą do tworzenia klasyfikatora regresji logistycznej.
  • Utwórz obiekt klasyfikatora i wytrenuj go na danych treningowych.
  • Wygeneruj predykcje dla danych testowych i utwórz macierz pomyłek.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the logistic regression class
from pyspark.ml.____ import ____

# Create a classifier object and train on training data
logistic = ____().____(____)

# Create predictions for the testing data and show confusion matrix
prediction = ____.____(____)
prediction.groupBy(____, ____).____().show()
Edytuj i uruchom kod