Cross validation
У наступних кількох вправах ви налаштовуватимете свою модель логістичної регресії за допомогою процедури, яка зветься k-fold cross validation (k-кратна перехресна перевірка). Це метод оцінювання продуктивності моделі на невидимих раніше даних (наприклад, ваш датафрейм test).
Метод працює так: тренувальні дані ділять на кілька частин. Точна кількість залежить від вас, але в цьому курсі ви використовуватимете значення за промовчанням у PySpark — три. Після поділу одну з частин відкладають, а модель навчають на решті. Потім помилку вимірюють на відкладеній частині. Це повторюють для кожної з частин, щоб кожен блок даних рівно один раз був відкладений і використаний як тестова вибірка. Потім помилки на всіх частинах усереднюють. Це й є помилка перехресної перевірки моделі — добра оцінка фактичної помилки на відкладених даних.
Ви використаєте перехресну перевірку, щоб вибрати гіперпараметри: створите сітку всіх можливих пар значень для двох гіперпараметрів — elasticNetParam і regParam — і за помилкою перехресної перевірки порівняєте всі моделі, щоб обрати найкращу!
Що дозволяє оцінити перехресна перевірка?
Ця вправа є частиною курсу
Основи PySpark
Практична інтерактивна вправа
Перетворіть теорію на практику за допомогою однієї з наших інтерактивних вправ
Почати вправу