Optimalizace filtru SMS spamu
Pipeline, kterou jsi dříve sestavil/a pro model detekce SMS spamu, používala výchozí parametry pro všechny své části. Je ale velmi nepravděpodobné, že by tyto parametry vedly k obzvlášť dobrému modelu. V tomto cvičení spustíš pipeline pro vybranou sadu hodnot parametrů. Budeme postupovat systematicky: hodnoty jednotlivých hyperparametrů rozmístíme do mřížky a pipeline pak systematicky projde každý její bod.
V tomto cvičení nastavíš mřížku parametrů, kterou pak lze využít při křížové validaci k výběru vhodné sady parametrů pro klasifikátor SMS spamu.
Následující objekty jsou již definovány:
hasher— objektHashingTFalogistic— objektLogisticRegression.
Toto cvičení je součástí kurzu
Machine Learning with PySpark
Pokyny k cvičení
- Vytvoř objekt pro sestavení mřížky parametrů.
- Přidej do mřížky body pro parametry
numFeaturesabinaryobjektuHashingTFs hodnotami 1024, 4096 a 16384, respektive True a False. - Přidej do mřížky body pro parametry
regParamaelasticNetParamobjektuLogisticRegressions hodnotami 0.01, 0.1, 1.0 a 10.0, respektive 0.0, 0.5 a 1.0. - Sestav mřížku parametrů.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create parameter grid
params = ____()
# Add grid for hashing trick parameters
params = params.____(____, ____) \
.____(____, ____)
# Add grid for logistic regression parameters
params = params.____(____, ____) \
.____(____, ____)
# Build parameter grid
params = ____.____()