EmpezarEmpieza gratis

Optimización de spam en SMS

El pipeline que creaste antes para el modelo de spam en SMS usaba los parámetros por defecto para todos los elementos. Es muy poco probable que esos parámetros produzcan un modelo especialmente bueno. En este ejercicio vas a ejecutar el pipeline con una selección de valores de parámetros. Lo haremos de forma sistemática: los valores de cada hiperparámetro se disponen en una cuadrícula y el pipeline se ejecuta de manera sistemática en cada punto de esa cuadrícula.

En este ejercicio configurarás una cuadrícula de parámetros para usar con validación cruzada y así elegir un buen conjunto de parámetros para el clasificador de spam en SMS.

Ya están definidos los siguientes objetos:

  • hasher, un objeto HashingTF, y
  • logistic, un objeto LogisticRegression.

Este ejercicio forma parte del curso

Machine learning con PySpark

Ver curso

Instrucciones del ejercicio

  • Crea un objeto constructor de cuadrículas de parámetros.
  • Añade puntos de cuadrícula para los parámetros numFeatures y binary del objeto HashingTF, dando los valores 1024, 4096 y 16384, y True y False, respectivamente.
  • Añade puntos de cuadrícula para los parámetros regParam y elasticNetParam del objeto LogisticRegression, con valores 0.01, 0.1, 1.0 y 10.0, y 0.0, 0.5 y 1.0, respectivamente.
  • Construye la cuadrícula de parámetros.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Create parameter grid
params = ____()

# Add grid for hashing trick parameters
params = params.____(____, ____) \
               .____(____, ____)

# Add grid for logistic regression parameters
params = params.____(____, ____) \
               .____(____, ____)

# Build parameter grid
params = ____.____()
Editar y ejecutar código