Trénování klasifikátoru spamu
SMS data jsou teď připravená pro sestavení klasifikátoru. Konkrétně jsi provedl/a tyto kroky:
- odstranění čísel a interpunkce
- rozdělení zpráv na slova (tzv. "tokeny")
- odstranění stop slov
- aplikování hašovacího triku
- převod na TF-IDF reprezentaci.
Nyní je potřeba rozdělit TF-IDF data na trénovací a testovací sadu. Pak pomocí trénovacích dat natrénuješ model Logistické regrese a nakonec vyhodnotíš jeho výkon na testovacích datech.
Data jsou uložena v proměnné sms a LogisticRegression je už importován.
Toto cvičení je součástí kurzu
Machine Learning with PySpark
Pokyny k cvičení
- Rozděl data na trénovací a testovací sadu v poměru 4:1. Nastav seed náhodného generátoru na hodnotu 13, aby byly výsledky opakovatelné.
- Vytvoř objekt
LogisticRegressiona natrénuj ho na trénovacích datech. - Vygeneruj predikce na testovacích datech.
- Použij predikce k sestavení matice záměn.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Split the data into training and testing sets
sms_train, sms_test = sms.____(____, ____)
# Fit a Logistic Regression model to the training data
logistic = ____(regParam=0.2).____(____)
# Make predictions on the testing data
prediction = logistic.____(____)
# Create a confusion matrix, comparing predictions to known labels
prediction.groupBy(____, ____).____().____()