НачатьНачать бесплатно

Оптимизация классификатора спама для SMS

Конвейер, который вы построили ранее для модели классификации спама в SMS, использовал параметры по умолчанию для всех своих элементов. Однако вряд ли такие параметры обеспечат особенно хорошее качество модели. В этом упражнении вы запустите конвейер для набора различных значений параметров. Мы сделаем это систематически: значения каждого гиперпараметра будут расположены на сетке, и конвейер последовательно пройдёт по каждой точке этой сетки.

В этом упражнении вы настроите сетку параметров, которую можно использовать совместно с перекрёстной проверкой для выбора оптимального набора параметров классификатора спама.

Следующие объекты уже определены:

  • hasher — объект HashingTF;
  • logistic — объект LogisticRegression.

Это упражнение является частью курса

Машинное обучение с PySpark

Посмотреть курс

Инструкции к упражнению

  • Создайте объект построителя сетки параметров.
  • Добавьте точки сетки для параметров numFeatures и binary объекта HashingTF, задав значения 1024, 4096 и 16384, а также True и False соответственно.
  • Добавьте точки сетки для параметров regParam и elasticNetParam объекта LogisticRegression, задав значения 0.01, 0.1, 1.0 и 10.0, а также 0.0, 0.5 и 1.0 соответственно.
  • Постройте сетку параметров.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Create parameter grid
params = ____()

# Add grid for hashing trick parameters
params = params.____(____, ____) \
               .____(____, ____)

# Add grid for logistic regression parameters
params = params.____(____, ____) \
               .____(____, ____)

# Build parameter grid
params = ____.____()
Редактировать и запускать код