Ottimizzazione SMS spam
La pipeline che hai costruito in precedenza per il modello di SMS spam utilizzava i parametri predefiniti per tutti gli elementi. È però molto improbabile che questi parametri portino a un modello particolarmente buono. In questo esercizio eseguirai la pipeline con una selezione di valori di parametro. Lo faremo in modo sistematico: i valori di ciascun iperparametro verranno disposti su una griglia e la pipeline verrà eseguita in modo sistematico su ogni punto della griglia.
In questo esercizio imposterai una griglia di parametri da usare con la validazione incrociata per scegliere un buon set di parametri per il classificatore di SMS spam.
Sono già definiti:
hasher— un oggettoHashingTFelogistic— un oggettoLogisticRegression.
Questo esercizio fa parte del corso
Machine Learning con PySpark
Istruzioni dell'esercizio
- Crea un oggetto builder per la griglia di parametri.
- Aggiungi punti di griglia per i parametri
numFeaturesebinarydell'oggettoHashingTF, fornendo rispettivamente i valori 1024, 4096 e 16384, e True e False. - Aggiungi punti di griglia per i parametri
regParameelasticNetParamdell'oggettoLogisticRegression, fornendo rispettivamente i valori 0.01, 0.1, 1.0 e 10.0, e 0.0, 0.5 e 1.0. - Costruisci la griglia di parametri.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Create parameter grid
params = ____()
# Add grid for hashing trick parameters
params = params.____(____, ____) \
.____(____, ____)
# Add grid for logistic regression parameters
params = params.____(____, ____) \
.____(____, ____)
# Build parameter grid
params = ____.____()