Inizia subitoInizia gratis

Ottimizzazione SMS spam

La pipeline che hai costruito in precedenza per il modello di SMS spam utilizzava i parametri predefiniti per tutti gli elementi. È però molto improbabile che questi parametri portino a un modello particolarmente buono. In questo esercizio eseguirai la pipeline con una selezione di valori di parametro. Lo faremo in modo sistematico: i valori di ciascun iperparametro verranno disposti su una griglia e la pipeline verrà eseguita in modo sistematico su ogni punto della griglia.

In questo esercizio imposterai una griglia di parametri da usare con la validazione incrociata per scegliere un buon set di parametri per il classificatore di SMS spam.

Sono già definiti:

  • hasher — un oggetto HashingTF e
  • logistic — un oggetto LogisticRegression.

Questo esercizio fa parte del corso

Machine Learning con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Crea un oggetto builder per la griglia di parametri.
  • Aggiungi punti di griglia per i parametri numFeatures e binary dell'oggetto HashingTF, fornendo rispettivamente i valori 1024, 4096 e 16384, e True e False.
  • Aggiungi punti di griglia per i parametri regParam e elasticNetParam dell'oggetto LogisticRegression, fornendo rispettivamente i valori 0.01, 0.1, 1.0 e 10.0, e 0.0, 0.5 e 1.0.
  • Costruisci la griglia di parametri.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Create parameter grid
params = ____()

# Add grid for hashing trick parameters
params = params.____(____, ____) \
               .____(____, ____)

# Add grid for logistic regression parameters
params = params.____(____, ____) \
               .____(____, ____)

# Build parameter grid
params = ____.____()
Modifica ed esegui il codice