Začněte nyníZačněte zdarma

Optimalizace filtru SMS spamu

Pipeline, kterou jsi dříve sestavil/a pro model detekce SMS spamu, používala výchozí parametry pro všechny své části. Je ale velmi nepravděpodobné, že by tyto parametry vedly k obzvlášť dobrému modelu. V tomto cvičení spustíš pipeline pro vybranou sadu hodnot parametrů. Budeme postupovat systematicky: hodnoty jednotlivých hyperparametrů rozmístíme do mřížky a pipeline pak systematicky projde každý její bod.

V tomto cvičení nastavíš mřížku parametrů, kterou pak lze využít při křížové validaci k výběru vhodné sady parametrů pro klasifikátor SMS spamu.

Následující objekty jsou již definovány:

  • hasher — objekt HashingTF a
  • logistic — objekt LogisticRegression.

Toto cvičení je součástí kurzu

Machine Learning with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř objekt pro sestavení mřížky parametrů.
  • Přidej do mřížky body pro parametry numFeatures a binary objektu HashingTF s hodnotami 1024, 4096 a 16384, respektive True a False.
  • Přidej do mřížky body pro parametry regParam a elasticNetParam objektu LogisticRegression s hodnotami 0.01, 0.1, 1.0 a 10.0, respektive 0.0, 0.5 a 1.0.
  • Sestav mřížku parametrů.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Create parameter grid
params = ____()

# Add grid for hashing trick parameters
params = params.____(____, ____) \
               .____(____, ____)

# Add grid for logistic regression parameters
params = params.____(____, ____) \
               .____(____, ____)

# Build parameter grid
params = ____.____()
Upravit a spustit kód