SMS spam optimizat
Pipeline-ul pe care l-ai construit anterior pentru modelul de detecție a spam-ului SMS a folosit parametrii impliciți pentru toate elementele din pipeline. Este puțin probabil că acești parametri vor produce un model deosebit de performant. În acest exercițiu vei rula pipeline-ul pentru o selecție de valori ale parametrilor. Vom face acest lucru într-un mod sistematic: valorile pentru fiecare hiperparametru vor fi dispuse pe o grilă, iar pipeline-ul va parcurge sistematic fiecare punct din acea grilă.
În acest exercițiu vei configura o grilă de parametri care poate fi utilizată cu validarea încrucișată pentru a alege un set bun de parametri pentru clasificatorul de spam SMS.
Următoarele sunt deja definite:
hasher— un obiectHashingTFșilogistic— un obiectLogisticRegression.
Acest exercițiu face parte din cursul
Machine Learning cu PySpark
Instrucțiuni pentru exercițiu
- Creează un obiect de tip constructor pentru grila de parametri.
- Adaugă puncte de grilă pentru parametrii
numFeaturesșibinaryla obiectulHashingTF, specificând valorile 1024, 4096 și 16384, respectiv True și False. - Adaugă puncte de grilă pentru parametrii
regParamșielasticNetParamla obiectulLogisticRegression, specificând valorile 0.01, 0.1, 1.0 și 10.0, respectiv 0.0, 0.5 și 1.0. - Construiește grila de parametri.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create parameter grid
params = ____()
# Add grid for hashing trick parameters
params = params.____(____, ____) \
.____(____, ____)
# Add grid for logistic regression parameters
params = params.____(____, ____) \
.____(____, ____)
# Build parameter grid
params = ____.____()