ПочатиПочніть безкоштовно

Оптимізація SMS spam

Пайплайн, який ви раніше створили для моделі визначення спаму в SMS, використовував параметри за замовчуванням для всіх етапів. Однак малоймовірно, що такі параметри дадуть справді добру модель. У цій вправі ви запустите пайплайн для добору різних значень параметрів. Ми зробимо це системно: значення для кожного гіперпараметра будуть розкладені на сітці, і пайплайн послідовно запуститься для кожної точки цієї сітки.

У цій вправі ви налаштуєте сітку параметрів, яку можна використати разом із крос‑валідацією, щоб обрати вдалий набір параметрів для класифікатора SMS‑спаму.

Уже визначено:

  • hasher — об'єкт HashingTF і
  • logistic — об'єкт LogisticRegression.

Ця вправа є частиною курсу

Machine Learning з PySpark

Переглянути курс

Інструкції до вправи

  • Створіть об'єкт будівника сітки параметрів.
  • Додайте точки сітки для параметрів numFeatures і binary об'єкта HashingTF, надавши відповідно значення 1024, 4096 і 16384, а також True і False.
  • Додайте точки сітки для параметрів regParam і elasticNetParam об'єкта LogisticRegression, задавши відповідно значення 0.01, 0.1, 1.0 і 10.0, а також 0.0, 0.5 і 1.0.
  • Побудуйте сітку параметрів.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Create parameter grid
params = ____()

# Add grid for hashing trick parameters
params = params.____(____, ____) \
               .____(____, ____)

# Add grid for logistic regression parameters
params = params.____(____, ____) \
               .____(____, ____)

# Build parameter grid
params = ____.____()
Редагувати та запускати код