Czym jest regresja logistyczna?
Model, który będziesz dopasowywać w tym rozdziale, to regresja logistyczna. Jest bardzo podobna do regresji liniowej – z tą różnicą, że zamiast przewidywać wartość liczbową, szacuje prawdopodobieństwo (w zakresie od 0 do 1) wystąpienia danego zdarzenia.
Aby używać jej jako algorytmu klasyfikacji, wystarczy wyznaczyć punkt odcięcia dla tych prawdopodobieństw. Jeśli przewidywane prawdopodobieństwo jest powyżej tego progu, obserwacja zostaje sklasyfikowana jako „tak" (w tym przypadku – lot jest opóźniony); jeśli jest poniżej – jako „nie"!
Będziesz dostrajać ten model, testując różne wartości kilku hiperparametrów. Hiperparametr to wartość w modelu, która nie jest szacowana na podstawie danych – dostarczasz ją samodzielnie, aby zmaksymalizować wydajność modelu. W tym kursie nie musisz znać matematyki stojącej za tymi wartościami – ważne jest, że wypróbujesz kilka różnych opcji i wybierzesz najlepszą.
Po co dostarcza się hiperparametry?
To ćwiczenie jest częścią kursu
Podstawy PySpark
Interaktywne ćwiczenie praktyczne
Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń
Rozpocznij ćwiczenie