Optimización de spam en SMS
El pipeline que creaste antes para el modelo de spam en SMS usaba los parámetros por defecto para todos los elementos. Es muy poco probable que esos parámetros produzcan un modelo especialmente bueno. En este ejercicio vas a ejecutar el pipeline con una selección de valores de parámetros. Lo haremos de forma sistemática: los valores de cada hiperparámetro se disponen en una cuadrícula y el pipeline se ejecuta de manera sistemática en cada punto de esa cuadrícula.
En este ejercicio configurarás una cuadrícula de parámetros para usar con validación cruzada y así elegir un buen conjunto de parámetros para el clasificador de spam en SMS.
Ya están definidos los siguientes objetos:
hasher, un objetoHashingTF, ylogistic, un objetoLogisticRegression.
Este ejercicio forma parte del curso
Machine learning con PySpark
Instrucciones del ejercicio
- Crea un objeto constructor de cuadrículas de parámetros.
- Añade puntos de cuadrícula para los parámetros
numFeaturesybinarydel objetoHashingTF, dando los valores 1024, 4096 y 16384, y True y False, respectivamente. - Añade puntos de cuadrícula para los parámetros
regParamyelasticNetParamdel objetoLogisticRegression, con valores 0.01, 0.1, 1.0 y 10.0, y 0.0, 0.5 y 1.0, respectivamente. - Construye la cuadrícula de parámetros.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Create parameter grid
params = ____()
# Add grid for hashing trick parameters
params = params.____(____, ____) \
.____(____, ____)
# Add grid for logistic regression parameters
params = params.____(____, ____) \
.____(____, ____)
# Build parameter grid
params = ____.____()