Začněte nyníZačněte zdarma

Křížová validace

V několika následujících cvičeních budeš ladit svůj model logistické regrese pomocí metody zvané k-fold křížová validace. Jde o způsob, jak odhadnout výkonnost modelu na dosud neviděných datech (například na tvém DataFrame test).

Metoda funguje tak, že trénovací data rozdělíš do několika částí. Jejich počet je na tobě, ale v tomto kurzu se používá výchozí hodnota PySparku, tedy tři. Po rozdělení dat se jedna část odloží stranou a model se natrénuje na zbývajících. Poté se změří chyba na odložené části. Tento postup se opakuje pro každou část, takže každý blok dat je jednou použit jako testovací sada. Nakonec se chyby ze všech částí zprůměrují. Výsledek se nazývá chyba křížové validace a je dobrým odhadem skutečné chyby na odložených datech.

Křížovou validaci použiješ k výběru hyperparametrů: vytvoříš mřížku všech možných kombinací hodnot dvou hyperparametrů – elasticNetParam a regParam – a porovnáš všechny modely pomocí chyby křížové validace, abys vybral/a ten nejlepší!

Co ti křížová validace umožňuje odhadnout?

Toto cvičení je součástí kurzu

Foundations of PySpark

Zobrazit kurz

Interaktivní praktické cvičení

Proměňte teorii v praxi s jedním z našich interaktivních cvičení

Začít cvičení