Začněte nyníZačněte zdarma

Trénování klasifikátoru spamu

SMS data jsou teď připravená pro sestavení klasifikátoru. Konkrétně jsi provedl/a tyto kroky:

  • odstranění čísel a interpunkce
  • rozdělení zpráv na slova (tzv. "tokeny")
  • odstranění stop slov
  • aplikování hašovacího triku
  • převod na TF-IDF reprezentaci.

Nyní je potřeba rozdělit TF-IDF data na trénovací a testovací sadu. Pak pomocí trénovacích dat natrénuješ model Logistické regrese a nakonec vyhodnotíš jeho výkon na testovacích datech.

Data jsou uložena v proměnné sms a LogisticRegression je už importován.

Toto cvičení je součástí kurzu

Machine Learning with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Rozděl data na trénovací a testovací sadu v poměru 4:1. Nastav seed náhodného generátoru na hodnotu 13, aby byly výsledky opakovatelné.
  • Vytvoř objekt LogisticRegression a natrénuj ho na trénovacích datech.
  • Vygeneruj predikce na testovacích datech.
  • Použij predikce k sestavení matice záměn.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Split the data into training and testing sets
sms_train, sms_test = sms.____(____, ____)

# Fit a Logistic Regression model to the training data
logistic = ____(regParam=0.2).____(____)

# Make predictions on the testing data
prediction = logistic.____(____)

# Create a confusion matrix, comparing predictions to known labels
prediction.groupBy(____, ____).____().____()
Upravit a spustit kód