Оптимізація SMS spam
Пайплайн, який ви раніше створили для моделі визначення спаму в SMS, використовував параметри за замовчуванням для всіх етапів. Однак малоймовірно, що такі параметри дадуть справді добру модель. У цій вправі ви запустите пайплайн для добору різних значень параметрів. Ми зробимо це системно: значення для кожного гіперпараметра будуть розкладені на сітці, і пайплайн послідовно запуститься для кожної точки цієї сітки.
У цій вправі ви налаштуєте сітку параметрів, яку можна використати разом із крос‑валідацією, щоб обрати вдалий набір параметрів для класифікатора SMS‑спаму.
Уже визначено:
hasher— об'єктHashingTFіlogistic— об'єктLogisticRegression.
Ця вправа є частиною курсу
Machine Learning з PySpark
Інструкції до вправи
- Створіть об'єкт будівника сітки параметрів.
- Додайте точки сітки для параметрів
numFeaturesіbinaryоб'єктаHashingTF, надавши відповідно значення 1024, 4096 і 16384, а також True і False. - Додайте точки сітки для параметрів
regParamіelasticNetParamоб'єктаLogisticRegression, задавши відповідно значення 0.01, 0.1, 1.0 і 10.0, а також 0.0, 0.5 і 1.0. - Побудуйте сітку параметрів.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Create parameter grid
params = ____()
# Add grid for hashing trick parameters
params = params.____(____, ____) \
.____(____, ____)
# Add grid for logistic regression parameters
params = params.____(____, ____) \
.____(____, ____)
# Build parameter grid
params = ____.____()