ПочатиПочніть безкоштовно

Cross validation

У наступних кількох вправах ви налаштовуватимете свою модель логістичної регресії за допомогою процедури, яка зветься k-fold cross validation (k-кратна перехресна перевірка). Це метод оцінювання продуктивності моделі на невидимих раніше даних (наприклад, ваш датафрейм test).

Метод працює так: тренувальні дані ділять на кілька частин. Точна кількість залежить від вас, але в цьому курсі ви використовуватимете значення за промовчанням у PySpark — три. Після поділу одну з частин відкладають, а модель навчають на решті. Потім помилку вимірюють на відкладеній частині. Це повторюють для кожної з частин, щоб кожен блок даних рівно один раз був відкладений і використаний як тестова вибірка. Потім помилки на всіх частинах усереднюють. Це й є помилка перехресної перевірки моделі — добра оцінка фактичної помилки на відкладених даних.

Ви використаєте перехресну перевірку, щоб вибрати гіперпараметри: створите сітку всіх можливих пар значень для двох гіперпараметрів — elasticNetParam і regParam — і за помилкою перехресної перевірки порівняєте всі моделі, щоб обрати найкращу!

Що дозволяє оцінити перехресна перевірка?

Ця вправа є частиною курсу

Основи PySpark

Переглянути курс

Практична інтерактивна вправа

Перетворіть теорію на практику за допомогою однієї з наших інтерактивних вправ

Почати вправу