Оптимизация классификатора спама для SMS
Конвейер, который вы построили ранее для модели классификации спама в SMS, использовал параметры по умолчанию для всех своих элементов. Однако вряд ли такие параметры обеспечат особенно хорошее качество модели. В этом упражнении вы запустите конвейер для набора различных значений параметров. Мы сделаем это систематически: значения каждого гиперпараметра будут расположены на сетке, и конвейер последовательно пройдёт по каждой точке этой сетки.
В этом упражнении вы настроите сетку параметров, которую можно использовать совместно с перекрёстной проверкой для выбора оптимального набора параметров классификатора спама.
Следующие объекты уже определены:
hasher— объектHashingTF;logistic— объектLogisticRegression.
Это упражнение является частью курса
Машинное обучение с PySpark
Инструкции к упражнению
- Создайте объект построителя сетки параметров.
- Добавьте точки сетки для параметров
numFeaturesиbinaryобъектаHashingTF, задав значения 1024, 4096 и 16384, а также True и False соответственно. - Добавьте точки сетки для параметров
regParamиelasticNetParamобъектаLogisticRegression, задав значения 0.01, 0.1, 1.0 и 10.0, а также 0.0, 0.5 и 1.0 соответственно. - Постройте сетку параметров.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create parameter grid
params = ____()
# Add grid for hashing trick parameters
params = params.____(____, ____) \
.____(____, ____)
# Add grid for logistic regression parameters
params = params.____(____, ____) \
.____(____, ____)
# Build parameter grid
params = ____.____()