Budowanie modelu regresji logistycznej
Wcześniej zbudowałeś/zbudowałaś model drzewa decyzyjnego na danych dotyczących lotów. Teraz czas na stworzenie modelu regresji logistycznej na tych samych danych.
Celem jest przewidzenie, czy dany lot z dużym prawdopodobieństwem opóźni się o co najmniej 15 minut (etykieta 1), czy nie (etykieta 0).
Chociaż masz do dyspozycji wiele zmiennych predykcyjnych, na razie skorzystasz tylko z kolumn mon, depart i duration. Są to cechy numeryczne, które można bezpośrednio wykorzystać w modelu regresji logistycznej. Zanim będzie można dodać cechy kategoryczne, trzeba będzie wykonać kilka dodatkowych kroków. Szczegóły już wkrótce!
Dane zostały podzielone na zbiory treningowy i testowy, dostępne jako flights_train i flights_test.
To ćwiczenie jest częścią kursu
Uczenie maszynowe z PySpark
Instrukcje do ćwiczenia
- Zaimportuj klasę służącą do tworzenia klasyfikatora regresji logistycznej.
- Utwórz obiekt klasyfikatora i wytrenuj go na danych treningowych.
- Wygeneruj predykcje dla danych testowych i utwórz macierz pomyłek.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the logistic regression class
from pyspark.ml.____ import ____
# Create a classifier object and train on training data
logistic = ____().____(____)
# Create predictions for the testing data and show confusion matrix
prediction = ____.____(____)
prediction.groupBy(____, ____).____().show()