Zacznij terazZacznij za darmo

Walidacja krzyżowa

W kolejnych ćwiczeniach będziesz strojić swój model regresji logistycznej za pomocą metody zwanej k-krotną walidacją krzyżową. To technika pozwalająca ocenić, jak model poradzi sobie z nowymi danymi (np. z twoim DataFrame test).

Metoda polega na podziale danych treningowych na kilka partycji. Liczba partycji zależy od ciebie, ale w tym kursie korzystamy z domyślnej wartości PySpark, czyli trzech. Po podziale danych jedna z partycji jest odkładana na bok, a model jest dopasowywany do pozostałych. Następnie mierzy się błąd na wydzielonej partycji. Cały proces powtarza się dla każdej partycji, dzięki czemu każdy blok danych jest dokładnie raz używany jako zbiór testowy. Na koniec błędy ze wszystkich partycji są uśredniane. Wynik ten nazywamy błędem walidacji krzyżowej – to dobre oszacowanie rzeczywistego błędu na nowych danych.

Walidacji krzyżowej użyjesz do doboru hiperparametrów: stworzysz siatkę możliwych kombinacji wartości dwóch hiperparametrów – elasticNetParam i regParam – i porównasz wszystkie modele na podstawie błędu walidacji krzyżowej, aby wybrać najlepszy!

Co pozwala oszacować walidacja krzyżowa?

To ćwiczenie jest częścią kursu

Podstawy PySpark

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń

Rozpocznij ćwiczenie