Comece agoraComece grátis

SMS spam otimizado

O pipeline que você construiu antes para o modelo de SMS spam usou os parâmetros padrão para todos os elementos. É bem improvável que esses parâmetros gerem um modelo muito bom. Neste exercício, você vai executar o pipeline para uma seleção de valores de parâmetros. Vamos fazer isso de forma sistemática: os valores de cada hiperparâmetro serão organizados em uma grade e, em seguida, o pipeline será executado de maneira sistemática em cada ponto dessa grade.

Neste exercício, você vai configurar uma grade de parâmetros que pode ser usada com validação cruzada para escolher um bom conjunto de parâmetros para o classificador de SMS spam.

Os seguintes objetos já estão definidos:

  • hasher — um objeto HashingTF e
  • logistic — um objeto LogisticRegression.

Este exercicio faz parte do curso

Machine learning com PySpark

Ver curso

Instruções do exercicio

  • Crie um objeto construtor de grade de parâmetros.
  • Adicione pontos de grade para os parâmetros numFeatures e binary do objeto HashingTF, atribuindo os valores 1024, 4096 e 16384, e True e False, respectivamente.
  • Adicione pontos de grade para os parâmetros regParam e elasticNetParam do objeto LogisticRegression, atribuindo os valores 0.01, 0.1, 1.0 e 10.0, e 0.0, 0.5 e 1.0, respectivamente.
  • Construa a grade de parâmetros.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Create parameter grid
params = ____()

# Add grid for hashing trick parameters
params = params.____(____, ____) \
               .____(____, ____)

# Add grid for logistic regression parameters
params = params.____(____, ____) \
               .____(____, ____)

# Build parameter grid
params = ____.____()
Editar e Executar Código